Le 1er septembre 2026, Perplexity a lancé le hybrid compute pour son application Mac, une architecture qui divise automatiquement chaque tâche IA en deux parties : le raisonnement général part dans le cloud, les données sensibles restent traitées localement sur l'appareil. Le 2 septembre, Perplexity a open-sourcé Lily, le moteur d'inférence local qui propulse cette fonctionnalité sur Apple Silicon.
La confidentialité des données est le frein numéro un que les directions d'entreprise citent pour ne pas adopter un assistant IA. La question revient de manière quasi systématique : si mes collaborateurs posent des questions à une IA sur nos contrats, nos projections financières ou nos fiches clients, où partent ces données ? Perplexity apporte en septembre 2026 une réponse architecturale concrète à cette préoccupation.
Cet article décrit précisément comment fonctionne cette séparation, ce que contient le moteur Lily open-sourcé, les conditions matérielles réelles pour en bénéficier, et les implications pour les organisations françaises qui souhaitent utiliser des assistants IA sur des données réglementées. Nous abordons aussi les limites qu'il serait malhonnête de passer sous silence.
Architecture : comment la séparation cloud / local fonctionne
Le hybrid compute de Perplexity divise chaque session Perplexity Computer en deux niveaux d'exécution selon la nature de la requête. Le niveau cloud s'appuie sur des modèles frontière hébergés sur les serveurs de Perplexity : il prend en charge le raisonnement général, les recherches web, la planification de tâches multi-étapes et toutes les opérations qui ne touchent pas à des données sensibles. Le niveau local tourne directement sur le Mac de l'utilisateur via le moteur Lily : il traite les fichiers privés, les informations à caractère personnel (PII), et exécute les actions directement sur l'appareil.
La séparation est automatique. Un classificateur de PII analyse chaque requête avant qu'elle soit traitée et décide du niveau d'exécution approprié. Perplexity a open-sourcé ce classificateur en même temps que Lily, ce qui permet aux équipes IT d'entreprise de l'inspecter, de le tester sur leurs propres données et, si nécessaire, de l'ajuster à leur contexte spécifique.
Concrètement, si un collaborateur demande à l'assistant d'analyser un contrat confidentiel stocké localement, cette opération ne quitte jamais le Mac. Si la même personne demande ensuite de rechercher la jurisprudence récente sur un point contractuel, cette partie passe par le cloud. L'utilisateur n'a rien à configurer : la bascule est transparente.
- Cloud : raisonnement général, recherche web, planification, requêtes non sensibles.
- Local : fichiers privés, PII, actions sur l'appareil (manipulation de fichiers, interactions avec des applications locales).
- Classificateur PII open-sourcé : auditable par les équipes IT, personnalisable selon les besoins de l'entreprise.
Lily : le moteur d'inférence local open-source
Lily est le moteur d'inférence que Perplexity a construit de zéro pour faire tourner Qwen3.6-35B-A3B sur Apple Silicon. Il a été open-sourcé les 2 et 3 septembre 2026 sur GitHub, sous le dépôt perplexityai/pplx-garden.
Techniquement, Lily se distingue par une conception qui court-circuite délibérément les frameworks habituels. L'architecture est la suivante : une couche Rust charge les poids du modèle et pilote la boucle de génération, une API compatible OpenAI chat-completions diffuse les tokens, et des noyaux Metal écrits à la main exécutent le modèle directement sur le GPU unifié des puces Apple. Ni PyTorch ni MLX ne se trouvent dans le chemin d'exécution.
Les chiffres de performance publiés par Perplexity indiquent une amélioration de 1,23x sur le débit de préfill et de 1,35x sur le débit de décodage par rapport à MLX-LM d'Apple, sur le même modèle Qwen3.6-35B-A3B. Ces gains s'expliquent par les noyaux Metal spécialisés, optimisés pour un modèle et un matériel précis, plutôt que pour la polyvalence d'un framework générique.
L'open-source de Lily présente un intérêt concret au-delà de l'application Perplexity Computer : le moteur peut être utilisé indépendamment pour faire tourner Qwen3.6-35B-A3B sur tout Mac Apple Silicon compatible, et son code sert de référence pour quiconque souhaite construire un moteur d'inférence local hautement optimisé.
Conditions d'accès et limites matérielles
Le hybrid compute de Perplexity est disponible pour les abonnés Pro, Max et Enterprise. Sur le plan matériel, les conditions sont précises et excluent une partie des configurations Mac courantes :
- Puce : Apple Silicon (M1 ou plus récent). Les Mac Intel ne sont pas pris en charge.
- Système : macOS 15 ou supérieur.
- Mémoire unifiée : au moins 24 Go. Cette exigence élimine les MacBook Air d'entrée de gamme (16 Go) et les Mac Mini de base.
Au moment de la publication, Perplexity n'a annoncé aucun calendrier pour une version Windows ou Linux du hybrid compute. La dépendance aux noyaux Metal d'Apple rend une portabilité directe peu probable à court terme.
Il y a une limite importante à signaler sur la classification automatique des PII : aucun classificateur n'est parfait. Des données sensibles pourraient passer en cloud par erreur de classification (faux négatif), en particulier pour des formats métier propriétaires que le modèle n'a pas été entraîné à reconnaître. Pour des données hautement sensibles (dossiers médicaux, secrets industriels, données couvertes par un accord de confidentialité strict), l'auditabilité du classificateur open-sourcé prend toute son importance : vérifier son comportement sur votre corpus réel, avant de l'utiliser en production, est une précaution élémentaire.
Par ailleurs, le traitement local ne supprime pas tous les risques : si le Mac de l'utilisateur est compromis (malware, accès physique non autorisé), les données locales restent exposées. La sécurité de l'endpoint reste un prérequis indépendant.
Enjeux concrets pour les entreprises françaises
L'architecture hybrid compute de Perplexity répond directement à deux problèmes concrets pour les organisations françaises : la conformité RGPD et la confidentialité métier.
Sur le plan RGPD, les données traitées on-device ne quittent jamais l'appareil, et donc ne sont transmises à aucun sous-traitant. Le raisonnement RGPD s'en trouve considérablement simplifié : il n'y a pas de transfert à qualifier, pas de DPA (Data Processing Agreement) à signer avec Perplexity pour les données sensibles, pas de question sur l'adéquation des garanties. Cela ne signifie pas que l'utilisation globale de Perplexity est sans qualification RGPD (les requêtes cloud restent concernées), mais le périmètre se réduit de façon substantielle.
Pour des professions réglementées ou des secteurs à haute sensibilité (santé, droit, finance, industrie avec secrets de fabrication), la possibilité d'utiliser un assistant IA puissant sur des documents confidentiels sans les exporter change la donne. Un cabinet d'avocat peut faire analyser une convention par l'IA sans que le texte passe sur les serveurs d'un acteur américain. Un département R&D peut faire synthétiser des résultats de tests internes sans risque de fuite involontaire.
La réserve principale pour les DSI : le parc Mac avec 24 Go de RAM n'est pas universel. Beaucoup d'organisations françaises travaillent majoritairement sur Windows. Dans ce cas, le hybrid compute de Perplexity n'est pas directement applicable — mais l'architecture qu'il incarne (frontière automatique entre cloud et local selon la sensibilité) peut être reproduite sur d'autres stacks. C'est précisément le type d'architecture que nous concevons pour des clients qui traitent des données réglementées sur des outils internes sur mesure.
Au-delà du Mac : ce que ce modèle préfigure
L'annonce de Perplexity est notable non seulement pour ses fonctionnalités immédiates, mais pour ce qu'elle valide à l'échelle du marché : la séparation automatique cloud / local selon la sensibilité des données est un pattern viable en production.
Jusqu'ici, les solutions IA d'entreprise se positionnaient sur deux extrêmes : soit tout dans le cloud (problème RGPD et confidentialité), soit tout on-premise (coût et complexité élevés). L'approche hybride intelligente — cloud pour la puissance de calcul et la recherche web, local pour les données confidentielles — offre un troisième chemin accessible.
Plusieurs signaux indiquent que d'autres acteurs vont s'emparer de ce modèle. Microsoft a annoncé des capacités Copilot+ sur ARM qui permettent d'exécuter des modèles localement. Des éditeurs de logiciels métier commencent à intégrer des petits modèles embarqués pour les opérations sensibles. La direction est claire.
Pour les organisations qui développent leurs propres outils internes, ce pattern est directement réplicable sans dépendre d'une application tierce : un modèle local léger (Mistral, Phi, Qwen) pour les données sensibles, un appel API vers un modèle cloud puissant pour les tâches génériques, et une couche de routage simple qui décide en fonction de la nature de la requête. Cette architecture peut être adaptée à des environnements Windows et Linux, et intégrée dans des flux d'automatisation métier existants. Si vous souhaitez évaluer comment ce type d'architecture s'applique à votre contexte, parlons de votre projet.
FAQ
Sources
FAQ — Perplexity Hybrid Compute : vos données sensibles restent sur le Mac, le cloud ne les voit jamais — architecture et limites réelles
Mes données sont-elles transmises à Perplexity si j'utilise le hybrid compute ?
Les données classifiées comme sensibles (PII, fichiers privés, actions sur l'appareil) sont traitées localement sur votre Mac par le moteur Lily et ne quittent jamais votre appareil. Seules les requêtes non sensibles (raisonnement général, recherches web) passent par les serveurs Perplexity. Un classificateur PII open-sourcé effectue la séparation automatiquement.
Lily peut-il être utilisé indépendamment de l'application Perplexity Computer ?
Oui. Lily est open-source (Rust + Metal) et disponible sur GitHub (perplexityai/pplx-garden). Il peut être utilisé pour faire tourner Qwen3.6-35B-A3B sur tout Mac Apple Silicon compatible, indépendamment de l'application Perplexity Computer. Le code est librement réutilisable et modifiable.
Quelles configurations Mac sont exactement compatibles ?
Il faut un Mac équipé d'une puce Apple Silicon (M1 ou plus récent), fonctionnant sous macOS 15 ou supérieur, avec au moins 24 Go de mémoire unifiée. Les MacBook Air de base (16 Go) et les Mac Intel ne sont pas compatibles. La fonctionnalité est réservée aux abonnés Perplexity Pro, Max ou Enterprise.
Le classificateur PII est-il fiable à 100 % ?
Non, aucun classificateur n'est parfait. Des données sensibles pourraient passer en cloud par erreur de classification, notamment pour des formats métier spécifiques que le modèle n'a pas été entraîné à reconnaître. Perplexity a open-sourcé le classificateur précisément pour permettre aux équipes IT de l'auditer et de le tester sur leurs propres corpus avant un déploiement en production.
Ce modèle hybrid compute est-il applicable en dehors de l'écosystème Mac et Perplexity ?
Oui. L'architecture (un modèle local pour les données sensibles, un appel cloud pour les tâches génériques, une couche de routage qui décide selon la nature de la requête) est un pattern reproductible sur d'autres environnements, y compris Windows et Linux, en combinant un modèle open-source on-premise avec une API cloud. C'est un design applicable à des outils internes sur mesure.
Quels sont les risques résiduels même avec le traitement local ?
Le traitement on-device ne supprime pas le risque endpoint : si le Mac est compromis (malware, accès physique non autorisé), les données locales restent exposées. La sécurité de l'appareil (chiffrement du disque, gestion des accès, EDR) reste un prérequis indépendant du hybrid compute. Le RGPD est simplifié, pas supprimé pour les requêtes cloud.