À leurs débuts, les assistants comme ChatGPT ne comprenaient que le texte. Une IA multimodale accepte aussi des images, des captures d’écran, des PDF, de l’audio ou de la vidéo, et peut parfois en produire. Vous pouvez lui envoyer la photo d’un tableau blanc, lui dicter une question ou lui demander un visuel. Les principaux assistants, de ChatGPT à Gemini en passant par Claude, fonctionnent aujourd’hui ainsi.

Au quotidien, cela ouvre des usages très concrets :

  • extraire les informations d’une facture ou d’un bon de livraison scanné ;
  • résumer l’enregistrement d’une réunion ;
  • analyser un graphique ou un tableau pris en photo ;
  • montrer un problème avec une capture d’écran plutôt qu’avec des mots.

C’est précieux pour créer un outil interne. Vous pouvez joindre à votre prompt un croquis de l’écran souhaité, une maquette ou la capture du tableur que l’outil doit remplacer. Pendant les tests, une capture d’écran du problème vaut souvent mieux qu’une longue explication : Claude Code sait la lire.

Deux précautions, toutefois. Une image peut contenir bien plus qu’on ne le croit : des noms, des montants, des données personnelles en arrière-plan. Et la lecture d’un document scanné n’est pas infaillible : un chiffre mal lu passe facilement inaperçu. Relisez donc les montants importants.

Exemple

Aux services généraux, Agathe prend en photo le tableau blanc d’un atelier ; l’IA en tire un compte rendu structuré, qu’Agathe relit avant de l’envoyer aux participants.