Un modèle classique écrit sa réponse d’un seul jet. Un modèle de raisonnement prend d’abord le temps de réfléchir : il décompose le problème, essaie plusieurs pistes, vérifie ses calculs et corrige ses erreurs, puis seulement il répond. Certains assistants affichent un résumé de cette réflexion pendant qu’elle se déroule.
Claude, ChatGPT et Gemini proposent tous ce type de réflexion. Les modèles les plus récents décident souvent eux-mêmes combien de temps réfléchir, selon la difficulté de la question, et certaines applications laissent choisir un niveau d’effort.
Cette réflexion est utile quand la question demande plusieurs étapes :
- un calcul ou une analyse de chiffres ;
- un problème de logique ou de planning ;
- la conception d’un outil, où il faut penser à tous les cas ;
- la recherche de la cause d’un bug.
Elle a un coût : la réponse arrive plus lentement et consomme davantage de tokens, donc davantage de votre limite d’usage. Pour reformuler un e-mail, elle n’apporte presque rien. Et un raisonnement bien présenté n’est pas une preuve : le modèle peut encore se tromper, avec des étapes qui ont l’air solides. Le mode Plan de Claude Code suit d’ailleurs la même logique : réfléchir et proposer une méthode avant de toucher à quoi que ce soit.
Exemple
Aux opérations, Quentin laisse son assistant réfléchir longuement pour construire le planning des équipes de nuit en respectant les temps de repos, mais choisit une réponse rapide pour rédiger la note de service.