Un modèle d’IA apprend à partir d’exemples, en quantité gigantesque. Pour un LLM, ce sont surtout des textes : pages web publiques, livres, articles, code informatique, données obtenues sous licence, et des exemples rédigés ou notés par des humains pour lui apprendre à bien répondre. Tout ce que le modèle sait vient de là.
Ces données expliquent une bonne part de son comportement :
- ses connaissances s’arrêtent à une date, celle de la fin de la collecte ;
- il ne connaît pas les informations internes de votre entreprise : vos clients, vos chiffres, vos règles ;
- il reproduit les biais et les erreurs présents dans ce qu’il a lu.
En entreprise, la question se pose souvent dans l’autre sens : mes échanges avec l’IA vont-ils servir à entraîner les prochains modèles ? Tout dépend de l’offre et des réglages. Les offres pour entreprises l’excluent en général par défaut ; les offres individuelles laissent souvent le choix dans les paramètres de confidentialité. Lisez les conditions avant d’y mettre des informations internes, et testez vos premiers outils avec des données inventées.
Le sujet est aussi juridique. Des auteurs et des éditeurs contestent l’usage de leurs œuvres sans autorisation, et l’AI Act impose aux fournisseurs de modèles d’IA à usage général, comme les grands LLM, de publier un résumé des données utilisées pour leur entraînement.
Exemple
Avant d’utiliser une IA pour préparer des synthèses d’entretiens de recrutement, Lucas vérifie avec la DSI que l’offre de l’entreprise exclut l’usage des conversations pour entraîner les modèles.