Aller au contenu principal
Agentic AI

Agents IA vs pipeline déterministe : la grille de décision

Agents IA vs pipeline déterministe : la grille de décision

[!NOTE] TL;DR 1) Si tu peux énumérer les chemins d'une tâche, un pipeline déterministe gagne sur le coût, la latence et l'audit. 2) Si tu ne peux pas, un agent IA se justifie, à condition d'être borné et validé par une couche déterministe. 3) Le choix se joue sur cinq critères mesurables, pas sur le vocabulaire d'une roadmap.

Un budget brûlé en quatre mois

Chez Uber, l'usage de Claude Code est passé de 32 % à 84 % des 5000 ingénieurs entre décembre 2025 et mars 2026. En avril, le budget IA annuel était épuisé. Le coût API mensuel par ingénieur se situait entre 500 et 2000 dollars.

Rien, dans cet incident, ne vient du modèle. Le débat « agents IA contre pipeline déterministe » n'est pas un débat de puissance. C'est un débat de contrôle. Un agent qui boucle renvoie son contexte complet à chaque itération, et le Stanford Digital Economy Lab mesure que ce contexte renvoyé pèse 62 % de la facture d'inférence. Le modèle ne réfléchit pas plus. Il relit.

Et ce compteur, personne ne le regarde. Il fuit dans une cave, sans témoin, et il ne s'arrête jamais tout seul.

La vraie question

Ma question centrale tient en une phrase: quand un agent IA est-il réellement justifié face à un pipeline déterministe ?

Deux définitions, puis j'avance. Un pipeline déterministe est un graphe que tu as écrit. Les conditions de branchement vivent dans le code, pas dans la tête du modèle. Un LLM peut y occuper un nœud (classer, extraire, résumer), il ne décide jamais de l'étape suivante. C'est la lecture que retiennent Eric Broda et Davis Broda dans Agentic Mesh: le workflow orchestre, l'agent décide.

Un agent inverse la propriété du contrôle. Le modèle choisit l'outil, lit le résultat, choisit l'action suivante, puis déclare lui-même que la tâche est finie. Tu lui donnes un objectif et une boîte à outils, pas un chemin.

Toute la différence de fiabilité tient dans cette inversion.

La grille des cinq critères

Cinq propriétés de la tâche décident. Pas l'enthousiasme de la roadmap.

La variance des entrées vient d'abord. Si tu peux énumérer les catégories réelles, un routage déterministe suffit. Si l'espace est ouvert, il casse au premier cas non prévu.

Le coût d'une erreur vient ensuite. Un brouillon raté se jette. Une écriture en base de production, un virement, une communication client ne se jettent pas.

Puis le budget de latence. Un pipeline déterministe répond en 50 à 200 ms. Une boucle agentique démarre autour de 3 secondes et grimpe à 15 s sur les cas difficiles.

Le coût par invocation arrive en quatrième. Un chat déclenche un appel. Gartner estime qu'une tâche agentique en déclenche 10 à 20. Anthropic mesure 4 fois plus de tokens qu'un chat pour un agent simple, et 15 fois pour un système multi-agents.

L'auditabilité ferme la marche. Un moteur de règles explique sa décision. Un agent produit une trace, qu'un humain doit lire pour reconstituer le raisonnement.

{
  "type": "bar",
  "data": {
    "labels": ["Chat simple", "Agent simple", "Système multi-agents"],
    "datasets": [
      {
        "label": "Tokens par tâche, en multiple d'un chat",
        "data": [1, 4, 15],
        "backgroundColor": ["#94a3b8", "#3b82f6", "#1d4ed8"]
      }
    ]
  },
  "options": {
    "responsive": true,
    "plugins": {
      "title": {
        "display": true,
        "text": "Consommation de tokens par tâche (mesures Anthropic, 2025)"
      }
    },
    "scales": {
      "y": {
        "title": { "display": true, "text": "Multiple d'un échange de chat" }
      }
    }
  }
}
Critère Pipeline déterministe Agent encadré Agent autonome
Variance des entrées Faible, énumérable Moyenne, longue traîne Ouverte, non énumérable
Coût d'une erreur Élevé ou irréversible Réversible, avec validation Faible et réversible
Budget de latence 50 à 200 ms 3 à 15 s 30 s et au-delà
Coût par invocation Un appel borné 4 à 15 fois un chat Distribution à longue queue
Auditabilité Règle explicable Trace plus décision déterministe Transcription à relire

Un dernier chiffre, et il est brutal. Microsoft Research mesure qu'une tâche de code agentique sur SWE-bench Verified consomme jusqu'à 1000 fois plus de tokens qu'un échange de chat, avec des écarts allant jusqu'à 30 fois sur la même tâche. Et plus de tokens n'a pas produit plus de précision.

L'argument décisif : le test de l'énumération

Je propose un critère unique, et je l'appelle le test de l'énumération. Une heure, un tableau blanc, une question posée sans complaisance: peux-tu dessiner les chemins réalistes de la tâche ? Si oui, tu as un pipeline. Si non, tu as un candidat agent.

Ce test a une vertu. Il transforme une discussion de préférence en observation. Tu ne demandes plus à ton équipe si elle aime les agents. Tu lui demandes de dessiner.

flowchart TD
    A[Peux-tu enumerer les chemins de la tache ?] -->|Oui| B[Pipeline deterministe]
    A -->|Non| C{Le cout d'une erreur est-il eleve ?}
    C -->|Oui| D[Agent borne, valide par une couche deterministe]
    C -->|Non| E{Le budget de latence est-il serre ?}
    E -->|Oui| B
    E -->|Non| F[Agent autonome avec plafonds durs]

Mais l'énumération ne suffit pas à tout dire. Une tâche peut être non énumérable tout en restant tolérable, si l'agent réussit de manière stable. C'est là que la thèse se joue, et que les chiffres publics sont moins flatteurs que les démos.

La précision monte, la fiabilité stagne

Le benchmark GAIA publié en 2023 donnait 92 % de réussite aux humains, contre environ 15 % pour GPT-4 équipé de plugins. Trois ans plus tard, la précision a grimpé pour de bon. La stabilité, beaucoup moins.

Le tableau de bord de fiabilité HAL évalue 15 agents sur douze métriques. Verdict: sur GAIA, GPT-5.5 et Claude Opus 4.7 ne sont pas plus fiables que leurs prédécesseurs, alors que leur précision progresse. L'écart entre la capacité (pass@k) et la régularité (pass^k) reste large pour tout le monde.

Le chiffre qui tranche vient d'une étude sur la stochasticité des évaluations agentiques. Sur GAIA niveau 3, GPT-4o atteint 6,6 % de précision avec un ICC de 0,304. Traduit: environ 70 % de la variance observée est du tirage run à run, pas de la difficulté de la tâche. GPT-5 monte à 44,2 % de précision et 0,629 d'ICC. Mieux, mais toujours pas un système sur lequel on appuie un bouton en production.

Un agent qui réussit une fois sur deux n'est pas un système dégradé. C'est un stagiaire brillant, et personne ne lui confie les virements.

C'est l'argument décisif, et il est économique. Tu ne paies pas une capacité, tu paies une distribution. La performance moyenne masque une queue de coûts et d'échecs que ton SLO ne sait pas absorber.

Les contre-exemples

Ma thèse échoue dans des cas précis, et il faut les nommer.

La remédiation d'incidents sur quinze types de systèmes en est un. Personne n'écrira quinze playbooks, et la prochaine panne ressemblera à aucune des quinze. Là, l'agent gagne, avec une allowlist d'outils stricte et une approbation humaine avant toute écriture en production.

La recherche ouverte en est un autre. Tu ne sais pas combien de sources il faudra lire, ni quand tu auras assez d'information. Le chemin est la valeur.

Il y a enfin le cas le plus fréquent, et le plus mal traité: le pipeline qui ossifie. Il résout 85 à 95 % des cas au lancement, puis plafonne. Les 5 % restants sont les plus intéressants, et aucune branche supplémentaire ne les couvrira. La bonne réponse n'est pas de remplacer le pipeline, c'est d'ouvrir une soupape vers un agent étroit, avec un plafond d'appels d'outils explicite.

Bien que le coût par tâche de cette soupape soit plus élevé, elle reste minoritaire en volume. Tu paies le tarif agentique sur 5 % du trafic, et le tarif déterministe sur le reste. Cette asymétrie est tout l'intérêt du montage hybride, et c'est celui que je déploie le plus souvent.

[!WARNING] La routage vers l'agent doit rester déterministe. Un routeur agentique propage ses erreurs de classification à tous les gestionnaires en aval, simultanément. C'est le point de défaillance le plus coûteux d'une architecture hybride.

Limites et angles morts

Mes chiffres viennent de sources tierces, pas d'un benchmark exécuté sur ta charge. Les prévisions Gartner (plus de 40 % des projets agentiques annulés d'ici fin 2027, coût par workflow multiplié par plus de cinq d'ici 2028) sont des prévisions, datées de juin 2025 et août 2026.

Ensuite, l'attribution de coût est encore immature. Les outils d'observabilité courants exposent un total de tokens par appel, sans séparer les tokens produits des tokens hérités. Une décomposition TCA récente montre que l'injection mémoire pèse environ 12 % de la facture et grimpe à 27,6 % à six niveaux de profondeur. Autrement dit, ton dashboard te cache une partie du problème.

Puis la conformité. L'article 14 du règlement européen sur l'IA attend une supervision humaine que le graphe d'un workflow fournit gratuitement. Un agent doit implémenter des interruptions runtime et un checkpointing d'état. Ce coût d'ingénierie se paie avant la mise en production.

Enfin, la métrique qui compte n'est pas dans un article: c'est ton taux de repli agentique. Suis-le comme une latence p95.

Cela pourrait facilement être testé. Construis le pipeline le plus simple, instrumente-le sur du trafic réel, regarde où il échoue. Si les échecs se regroupent en deux ou trois motifs, écris-les en code. S'ils sont vraiment en longue traîne, tu viens de gagner le droit d'ajouter un agent, avec des preuves plutôt qu'une intuition.

Le principe qui survit à l'exemple

Plus généralement, un agent est une option d'achat sur l'imprévu, et une option se paie en prime à chaque exécution. Tant que l'incertitude que tu achètes coûte moins cher que la branche en code qu'elle remplace, l'agent est rentable.

Dès que l'inverse est vrai, tu subventionnes ta propre complexité! Le test de l'énumération, la mesure du taux de repli et une validation déterministe en sortie suffisent à trancher.

Le reste, c'est de la littérature de conférence.


Pour un pipeline d'extraction documentaire instrumenté de bout en bout, regarde nos produits. Pour cadrer cette décision sur ta charge réelle, parlons-en. Deux lectures complémentaires: le coût réel derrière le podium des benchmarks agents et les budgets d'appels d'outils.


Traitement en cours...
Traitement en cours...

Veuillez patienter

Opération sécurisée