Aller au contenu
WorldPaperBlog
ArticleDémo

Quand une IA devient un outil plutôt qu'un assistant

Le vrai saut n'est pas la conversation — c'est l'usage d'outils

Thomas Legrand · 12 août 2026 · 3 min de lecture

Du chatbot à l'agent : cet article explique ce que « tool use » veut dire concrètement, comment on le mesure, pourquoi le principal indicateur du domaine vient d'être abandonné, et ce que cela change dans le travail réel.

Thèmes abordés : Intelligence artificielle, Développement logiciel

Public visé : Développeurs, chefs de produit, curieux techniques

On a beaucoup commenté la conversation. C'était la partie visible, et la moins déterminante. Le basculement s'est produit ailleurs : le jour où un modèle a cessé de décrire ce qu'il ferait pour se mettre à le faire — ouvrir un fichier, lancer une commande, lire le résultat, recommencer.

Trois étapes, souvent confondues

Étape

Ce que le modèle produit

Qui exécute

Appel de fonction

Un objet structuré décrivant une intention

L'application

Usage d'outils

Une suite d'appels, en réagissant aux résultats

L'application, en boucle

Agent

Un objectif décomposé, poursuivi jusqu'au bout

Le modèle pilote la boucle

La différence entre la deuxième et la troisième ligne est celle qui compte : dans un cas, le développeur écrit la boucle ; dans l'autre, le modèle décide quand s'arrêter.

La boucle est toujours la même — observer, décider, agir — et c'est exactement celle de n'importe quel système de contrôle. Ce qui a changé, c'est la richesse de ce qui peut être observé et actionné.

Comment on l'a mesuré

Le domaine s'est fédéré autour d'un indicateur : SWE-bench Verified, publié par OpenAI en 2024 — un sous-ensemble de 489 tâches issues de vrais dépôts GitHub, filtrées pour leur clarté. La tâche est complète : comprendre un ticket, naviguer dans le dépôt, produire un correctif, faire passer les tests.

La progression annoncée par les fournisseurs, à prendre comme un ordre de grandeur :

fin 2024   ~50-55 %
mi-2025    ~65-70 %
début 2026 ~80 %

(scores auto-déclarés, protocoles non strictement comparables)

Le 23 février 2026, OpenAI a annoncé cesser de reporter SWE-bench Verified, estimant qu'il ne mesure plus les capacités de pointe. Un indicateur qu'on abandonne parce qu'il est saturé est un indicateur qui a rempli son rôle — mais cela laisse le domaine sans mesure partagée.

L'interopérabilité comme enjeu discret

Le Model Context Protocol (MCP) répond à un problème banal et coûteux : chaque intégration entre un modèle et un outil était jusque-là écrite sur mesure. Un protocole ouvert transforme un travail quadratique en travail linéaire.

C'est le genre de brique dont on ne parle pas et sans laquelle rien ne s'assemble. Le paysage des agents de code — Claude Code, GitHub Copilot, Cursor, Devin, OpenHands — en dépend directement.

Terminal affichant une sortie de commandes
Un agent ne devine pas : il exécute, lit la sortie, et corrige. La boucle est plus importante que le modèle.

Ce que ça change dans le travail réel

Le gain n'est pas là où on l'attend. Écrire du code n'a jamais été le goulot d'étranglement — comprendre l'existant, reproduire un bug, vérifier une hypothèse le sont. Un agent qui peut lancer les tests attaque précisément ces tâches.

Le revers est documenté et porte désormais un nom :

Le « vibe coding » produit du code qui fonctionne sur l'exemple montré. L'« AI slop » désigne ce qu'il en reste six mois plus tard dans une base de production.

La compétence qui prend de la valeur n'est donc pas la production de code, mais sa revue : savoir lire vite un correctif qu'on n'a pas écrit et décider s'il tient.

T

Thomas Legrand

Écrit sur la découvrabilité, l'édition et les outils pour les créateurs. Compte de démonstration.

Commentaires

Connectez-vous pour participer à la discussion.

Aucun commentaire pour le moment.