Découvrez ce qu'est un LLM, comment il est entraîné et pourquoi il semble tout savoir.
Ouvrir cette leçon dans KodokonVous avez sûrement déjà entendu parler de ChatGPT, Claude ou Gemini. Ce sont des IA génératives : des programmes informatiques capables de produire du texte nouveau (une explication, un résumé, un poème, du code) à partir d'une demande écrite. Le moteur qui se cache derrière s'appelle un LLM, pour *Large Language Model*, en français grand modèle de langage. Un « modèle », en informatique, est un programme qui a appris des régularités à partir d'exemples, au lieu d'appliquer des règles écrites une par une par un humain.
Le principe de base est étonnamment simple : un LLM est une machine à prédire la suite d'un texte. Quand vous lisez « Le chat dort sur le… », votre cerveau complète spontanément par « canapé » ou « lit ». Un LLM fait exactement cela, mais à très grande échelle : à chaque instant, il calcule quel mot (ou morceau de mot) a le plus de chances de venir ensuite, l'ajoute, puis recommence. Une réponse entière n'est donc rien d'autre qu'une longue suite de prédictions, mot après mot. C'est la même mécanique que la suggestion de mots de votre clavier de téléphone, en incomparablement plus puissant.
Vous êtes un professeur patient qui explique l'informatique à un grand débutant.
Expliquez-moi ce qu'est un grand modèle de langage (LLM) comme si j'avais 12 ans, sans aucun terme technique non défini.
Contraintes :
- Utilisez une analogie de la vie quotidienne.
- Maximum 10 phrases.
- Terminez par une question pour vérifier que j'ai compris.Comment cette machine apprend-elle à prédire aussi bien ? Grâce à l'entraînement : une phase (avant votre première conversation) pendant laquelle le modèle « lit » d'immenses quantités de textes - livres, articles, sites web, code informatique. À chaque phrase, on lui cache la suite et on lui demande de la deviner. Quand il se trompe, on ajuste légèrement ses paramètres, c'est-à-dire ses milliards de petits réglages internes. Répétez cela des milliards de fois, et le modèle finit par capturer la grammaire, le style, et énormément de connaissances présentes dans ses textes d'entraînement.
Voilà pourquoi une IA générative semble tout savoir : elle a « lu » une bibliothèque plus vaste que ce qu'un humain pourrait parcourir en mille vies. Mais attention à ce mot : *semble*. Le modèle ne consulte pas une encyclopédie au moment de répondre et ne « comprend » pas comme vous. Il calcule la suite de mots la plus plausible d'après son entraînement. La plupart du temps, plausible = vrai. Mais pas toujours, et c'est précisément l'objet de la prochaine leçon.
Je viens d'apprendre que les LLM fonctionnent par prédiction de texte, qu'ils sont entraînés sur d'immenses corpus et qu'ils ne font que produire la suite la plus plausible.
Posez-moi 3 questions, une par une, pour vérifier que j'ai vraiment compris ces trois idées.
Attendez ma réponse après chaque question, puis corrigez-moi avec bienveillance avant de poser la suivante.
Ne me donnez jamais la réponse avant que j'aie essayé.