Depuis le 18 août 2026, Snowflake propose dans Cortex AI Gateway une fonctionnalité de routage dynamique de modèles : plutôt que d'envoyer toutes les requêtes vers le même LLM frontier, la plateforme sélectionne automatiquement le modèle le plus adapté à chaque tâche, selon des critères de coût, de qualité et de latence définis par l'entreprise elle-même. C'est un changement de posture structurel pour les équipes data et IA qui gèrent des pipelines à fort volume.
L'annonce s'accompagne de métriques internes concrètes : des agents utilisant le routage dynamique ont construit un pipeline dbt avec jusqu'à 3× plus d'efficacité en tokens par rapport à une approche frontier-only, à qualité équivalente ; des équipes d'ingénierie ont traité le même volume de pull requests avec 25 % de tokens en moins. Ces chiffres sont issus des benchmarks internes de Snowflake — aucune validation indépendante n'existe encore à ce jour, ce qui appelle à les considérer comme une direction plutôt que comme une garantie.
Pour les entreprises qui ont commencé à automatiser leurs processus métier via des agents IA, cette annonce soulève une question pratique : est-ce le bon moment d'adopter Cortex AI Gateway comme couche de routage, ou faut-il attendre des données de terrain indépendantes ? Cet article détaille le fonctionnement réel, les modèles disponibles, les garde-fous et les scénarios d'adoption pertinents pour une PME ou ETI.
Le problème : des tokens frontier gaspillés sur des tâches simples
Dans un pipeline IA classique, toutes les requêtes — qu'il s'agisse de classer un e-mail, de générer une synthèse complexe ou de raisonner sur un problème multi-étapes — transitent par le même modèle frontier, quel que soit le niveau de complexité réel de la tâche. C'est l'équivalent de solliciter un expert senior pour chaque micro-tâche administrative de l'équipe.
Cette approche est coûteuse et souvent injustifiée. Un modèle frontier comme GPT-5.6 Sol ou Claude Opus 5 peut coûter de 5 à 25 dollars le million de tokens d'entrée. Un modèle économique comme DeepSeek V4 Flash ou Gemini 3.7 Flash coûte entre 0,14 et 0,75 dollar le million — soit un rapport allant de 1 à 35 selon les paires comparées. Pour les pipelines à fort volume, la différence peut représenter des milliers d'euros par mois sans gain de qualité sur les tâches simples.
La réponse architecturale à ce problème existe depuis plusieurs années dans le monde du développement logiciel : les frameworks d'orchestration comme LangChain ou LlamaIndex permettent de router manuellement les requêtes vers différents modèles selon des règles codées. Mais cette configuration nécessite du code à maintenir, une expertise IA dédiée et une surveillance continue. Ce que propose Snowflake avec Cortex AI Gateway, c'est d'automatiser ce routage à l'intérieur de la plateforme de données — sans middleware supplémentaire pour les équipes déjà sur Snowflake.
L'enjeu pour les DSI et responsables IA est réel : l'intelligence efficiency — terme utilisé par Snowflake pour désigner le rapport entre la valeur métier produite et le volume de tokens consommés — est une métrique qui commence à apparaître dans les revues de performance des équipes data avancées. Snowflake se positionne comme la plateforme qui l'optimise nativement.
Comment fonctionne le routage dynamique Cortex
Le routage dynamique de Cortex AI Gateway fonctionne en trois étapes principales.
Premièrement, l'équipe configure une politique de routage : quels modèles sont approuvés pour quel workload, et selon quels critères de priorité (coût, qualité, latence). Cette politique est définie au niveau de l'application ou du workload — ce qui permet, par exemple, d'autoriser uniquement des modèles frontier pour un agent de génération de contrats juridiques, tout en permettant un mix plus large pour un agent de support client.
Deuxièmement, pour chaque requête entrante, Gateway évalue la complexité de la tâche en la comparant aux caractéristiques de performance et de coût réels de chaque modèle disponible. Cette évaluation est automatisée et se fait en temps réel, sans intervention humaine à l'exécution.
Troisièmement, Gateway route la requête vers le modèle identifié comme offrant le meilleur rapport qualité-coût pour cette tâche spécifique. Concrètement :
- Tâches simples ou répétitives — classification, extraction de données structurées, reformatage, résumés courts — sont dirigées vers des modèles économiques.
- Tâches à raisonnement approfondi — génération de code complexe, analyse multi-documents, raisonnement causal, synthèses stratégiques — sont routées vers des modèles frontier.
- Tâches intermédiaires sont évaluées dynamiquement selon les politiques et les données de performance observées.
Chaque décision de routage est tracée dans les journaux d'audit de Snowflake. Cela s'inscrit dans la stratégie plus large de la plateforme — illustrée par le rachat de Natoma en mai 2026 — de proposer une couche de gouvernance unifiée pour les données, modèles et agents. Pour les équipes IT, cela signifie qu'un responsable peut auditer quel modèle a répondu à quelle requête, avec quel coût, sans instrumentation supplémentaire.
Les chiffres communiqués : 3× et 25 %
Snowflake a publié deux métriques issues de ses benchmarks internes pour quantifier le gain du routage dynamique :
- Des agents utilisant Cortex AI Gateway en mode routage dynamique ont construit un pipeline dbt avec jusqu'à 3× plus d'efficacité en tokens par rapport à une approche utilisant uniquement des modèles frontier, à qualité de pipeline finale équivalente.
- Des équipes d'ingénierie ont traité le même volume de pull requests avec 25 % de tokens en moins grâce au routage dynamique, sans dégradation de la qualité du code produit.
Ces deux métriques proviennent des benchmarks internes de Snowflake, publiés dans son communiqué de presse du 18 août et dans son billet de blog technique. Aucune validation par un tiers indépendant n'a été publiée à ce jour. Il est légitime de les considérer comme des repères de direction — significatifs même si partiellement confirmés — et non comme des chiffres garantis dans tout contexte.
Pour modéliser l'impact sur votre propre organisation : si votre pipeline consomme 10 millions de tokens frontier par mois à un coût moyen de 5 $/M, une amélioration même partielle de l'ordre de 30 à 50 % d'efficacité (hypothèse prudente, inférieure aux chiffres Snowflake) représenterait 1 500 à 2 500 euros d'économie mensuelle, soit 18 000 à 30 000 euros par an. Ce calcul mérite d'être reproduit sur votre propre charge de travail avant toute décision.
Le signal utile est moins dans le chiffre précis que dans la direction : les architectures de routage multi-modèles — qu'elles soient natives à une plateforme ou implémentées via un framework d'orchestration — deviennent une pratique standard pour les équipes qui gèrent des pipelines IA à fort volume.
Modèles disponibles : DeepSeek V4 Flash et GLM-5.3 ajoutés
En parallèle du routage dynamique, Snowflake annonce l'ajout de deux modèles open-weight dans Cortex AI :
- DeepSeek V4 Flash 0731 — la version allégée du modèle flagship de DeepSeek, publiée le 31 juillet 2026 sous licence MIT. Ce modèle est l'un des moins chers du marché (environ 0,14 $/M de tokens) et affiche des performances solides sur les tâches de coding, d'extraction structurée et de classification. Son utilisation en contexte européen nécessite d'évaluer les questions de souveraineté liées à son origine chinoise et au cadre juridique applicable (loi de renseignement chinoise de 2017).
- GLM-5.3 — le modèle de la série GLM de Zhipu AI, performant sur les tâches multilingues incluant le français. Mêmes précautions de souveraineté applicables.
Ces deux modèles constituent le tier économique du routage dynamique : ce sont eux qui absorberont les tâches simples et répétitives à faible coût. Les modèles frontier disponibles dans Cortex AI (OpenAI, Anthropic, Mistral selon disponibilité régionale) restent le tier supérieur.
Pour les entreprises soumises à des contraintes de conformité RGPD ou soucieuses de souveraineté sur leurs données, vérifiez impérativement la région de traitement associée à chaque modèle disponible dans Cortex AI Gateway avant d'activer le routage automatique sur des données sensibles. Un routage automatique vers DeepSeek ou GLM sur des données personnelles ou confidentielles sans contrôle préalable constitue un risque réglementaire concret.
Quatre questions à trancher avant d'activer
Quatre questions pratiques à résoudre avant d'activer le routage dynamique en production :
- Votre stack est-elle déjà sur Snowflake ? Le routage dynamique de Cortex AI Gateway ne s'adresse qu'aux équipes dont les données et pipelines IA transitent déjà par Snowflake. Si vous utilisez d'autres plateformes data (BigQuery, Databricks, entrepôt on-premise), ce mécanisme natif ne s'y applique pas. Vous devrez implémenter un routage équivalent dans votre propre orchestrateur — ce qui est faisable mais représente un développement à prévoir.
- Votre volume justifie-t-il l'optimisation ? En dessous de quelques millions de tokens par mois, le gain absolu reste limité. Calculez votre consommation actuelle et modélisez le gain potentiel à 30 % d'efficacité (hypothèse prudente) avant de budgéter l'implémentation.
- Vos tâches sont-elles suffisamment différenciées en complexité ? Le routage dynamique apporte le plus de valeur quand un même pipeline mélange des requêtes de complexité très variable. Si 90 % de vos requêtes sont de nature similaire (toutes simples ou toutes complexes), le gain de routage sera marginal.
- Avez-vous des contraintes de souveraineté ? Si c'est le cas, définissez explicitement la liste des modèles autorisés dans votre politique de routage avant d'activer le routage automatique. Un routage non contrôlé peut diriger des données sensibles vers des modèles que votre politique de sécurité n'autorise pas.
Si vous concevez ou refactorisez une architecture data et IA sur mesure, la couche de routage des modèles est une décision d'architecture à anticiper dès la conception — que vous passiez par Cortex AI Gateway, un framework open-source ou une couche middleware dédiée. Parlons-en si vous souhaitez un cadrage sur votre situation spécifique.
FAQ
Sources
FAQ — Snowflake Cortex AI Gateway introduit le routage dynamique de modèles le 18 août : 3× plus efficace selon les benchmarks — fonctionnement, modèles disponibles et points de vigilance
Le routage dynamique de Snowflake fonctionne-t-il avec des modèles hébergés hors de Snowflake ?
Non. Le routage dynamique de Cortex AI Gateway s'applique uniquement aux modèles disponibles dans l'écosystème Snowflake Cortex AI. Si vous utilisez des LLM via votre propre compte OpenAI, Anthropic ou Google directement, ce mécanisme de routage ne s'y applique pas. Pour un routage cross-plateforme, il faut implémenter une couche d'orchestration dans votre propre infrastructure.
Les données transitent-elles par l'infrastructure Snowflake lors du routage dynamique ?
Oui. Toutes les requêtes routées par Cortex AI Gateway restent dans l'environnement Snowflake et sont soumises à la région de déploiement de votre instance. La politique de données (RGPD, NIS2, données sensibles) s'applique selon la région configurée pour votre compte Snowflake — à vérifier selon vos contrats et exigences de conformité.
Les benchmarks de 3× de gain en efficacité sont-ils vérifiés par des tiers indépendants ?
Non, à la date du 22 août 2026. Ces chiffres proviennent des benchmarks internes de Snowflake, publiés dans son communiqué de presse et son blog technique du 18 août. Aucun test indépendant n'a encore confirmé ou nuancé ces résultats. Il est conseillé de les reproduire sur votre propre charge de travail avant de les intégrer à vos estimations de ROI.
Le routage dynamique est-il disponible immédiatement pour tous les clients Snowflake ?
Snowflake a annoncé la fonctionnalité le 18 août 2026 comme disponible dans Cortex AI Gateway. Les déploiements se font parfois progressivement selon les régions et les tiers de compte enterprise. Vérifiez la disponibilité dans votre console Snowflake ou auprès de votre interlocuteur commercial Snowflake.
Quels modèles frontier sont disponibles dans Cortex AI pour le tier supérieur du routage ?
La disponibilité des modèles frontier dans Snowflake Cortex AI varie selon les régions et les accords commerciaux de Snowflake avec chaque fournisseur. Cortex AI propose des modèles d'OpenAI, Anthropic et Mistral, avec une disponibilité régionale à vérifier selon votre contrat. La liste officielle et à jour est disponible dans la documentation Snowflake Cortex AI.
Doit-on écrire du code pour configurer le routage dynamique, ou est-ce géré via une interface ?
Snowflake indique que les politiques de routage se configurent via des paramètres définis au niveau de l'application ou du workload dans Cortex AI Gateway. La configuration initiale peut nécessiter une intervention technique pour définir les règles de routage (modèles approuvés, priorités coût/qualité/latence), mais n'implique pas de réécriture de votre logique applicative.