Quand une IA devient un outil plutôt qu'un assistant
Le vrai saut n'est pas la conversation — c'est l'usage d'outils
Du chatbot à l'agent : cet article explique ce que « tool use » veut dire concrètement, comment on le mesure, pourquoi le principal indicateur du domaine vient d'être abandonné, et ce que cela change dans le travail réel.
Thèmes abordés : Intelligence artificielle, Développement logiciel
Public visé : Développeurs, chefs de produit, curieux techniques
On a beaucoup commenté la conversation. C'était la partie visible, et la moins déterminante. Le basculement s'est produit ailleurs : le jour où un modèle a cessé de décrire ce qu'il ferait pour se mettre à le faire — ouvrir un fichier, lancer une commande, lire le résultat, recommencer.
Trois étapes, souvent confondues
Étape | Ce que le modèle produit | Qui exécute |
|---|---|---|
Appel de fonction | Un objet structuré décrivant une intention | L'application |
Usage d'outils | Une suite d'appels, en réagissant aux résultats | L'application, en boucle |
Agent | Un objectif décomposé, poursuivi jusqu'au bout | Le modèle pilote la boucle |
La différence entre la deuxième et la troisième ligne est celle qui compte : dans un cas, le développeur écrit la boucle ; dans l'autre, le modèle décide quand s'arrêter.
La boucle est toujours la même — observer, décider, agir — et c'est exactement celle de n'importe quel système de contrôle. Ce qui a changé, c'est la richesse de ce qui peut être observé et actionné.
Comment on l'a mesuré
Le domaine s'est fédéré autour d'un indicateur : SWE-bench Verified, publié par OpenAI en 2024 — un sous-ensemble de 489 tâches issues de vrais dépôts GitHub, filtrées pour leur clarté. La tâche est complète : comprendre un ticket, naviguer dans le dépôt, produire un correctif, faire passer les tests.
La progression annoncée par les fournisseurs, à prendre comme un ordre de grandeur :
fin 2024 ~50-55 %
mi-2025 ~65-70 %
début 2026 ~80 %
(scores auto-déclarés, protocoles non strictement comparables)Le 23 février 2026, OpenAI a annoncé cesser de reporter SWE-bench Verified, estimant qu'il ne mesure plus les capacités de pointe. Un indicateur qu'on abandonne parce qu'il est saturé est un indicateur qui a rempli son rôle — mais cela laisse le domaine sans mesure partagée.
L'interopérabilité comme enjeu discret
Le Model Context Protocol (MCP) répond à un problème banal et coûteux : chaque intégration entre un modèle et un outil était jusque-là écrite sur mesure. Un protocole ouvert transforme un travail quadratique en travail linéaire.
C'est le genre de brique dont on ne parle pas et sans laquelle rien ne s'assemble. Le paysage des agents de code — Claude Code, GitHub Copilot, Cursor, Devin, OpenHands — en dépend directement.
Ce que ça change dans le travail réel
Le gain n'est pas là où on l'attend. Écrire du code n'a jamais été le goulot d'étranglement — comprendre l'existant, reproduire un bug, vérifier une hypothèse le sont. Un agent qui peut lancer les tests attaque précisément ces tâches.
Le revers est documenté et porte désormais un nom :
Le « vibe coding » produit du code qui fonctionne sur l'exemple montré. L'« AI slop » désigne ce qu'il en reste six mois plus tard dans une base de production.
La compétence qui prend de la valeur n'est donc pas la production de code, mais sa revue : savoir lire vite un correctif qu'on n'a pas écrit et décider s'il tient.
Thomas Legrand
Écrit sur la découvrabilité, l'édition et les outils pour les créateurs. Compte de démonstration.
Continuez votre lecture
GemPlus-LaChute
WorldPaperAdminil y a 3 heures
Réinventer la biologie
Camille Duvallil y a 14 heures
Créer sans perdre sa voix
Noor Belhadjil y a 21 heures
Des PNJ vraiment intelligents ?
Thomas Legrandavant-hier

Commentaires
Connectez-vous pour participer à la discussion.
Aucun commentaire pour le moment.