EPISODES

New

GPT-3, plus grand et soudainement capable de tout

Fondamentaux

Formation

À partir de GPT-3 et de ses 175 milliards de paramètres, découverte d’un paradoxe clé de l’IA moderne : comment grossir un modèle produit des progrès attendus… et des capacités émergentes imprévues.
Illustration pédagogique de GPT-3 montrant un réseau de neurones qui grossit, pour expliquer comment le passage à 175 milliards de paramètres fait émerger de nouvelles capacités en IA.
Comprendre l'IA d'aujourd'hui commence par savoir d'où elle vient. Un voyage de 1936 à ChatGPT.
épisode #13

Voir tous les épisodes de

Pour comprendre pourquoi GPT-3 a marqué un tournant en 2020, on peut partir d’un paradoxe. Et vous allez voir, il est assez fascinant.

D’un côté, sa progression suivait une logique très attendue, presque mécanique. De l’autre, ses capacités ont surpris jusqu’aux équipes qui l’avaient construit. Les deux idées sont vraies en même temps. Et c’est précisément ça qui rend GPT-3 si important.

Prenons d’abord la partie la plus prévisible. GPT-3 est un modèle de langage. Son principe de base est très simple à énoncer : il prédit le mot suivant. C’est tout. On lui donne une suite de mots, et il essaie de deviner le prochain.

Dit comme ça, on a presque envie de se dire : “Bon, rien de spectaculaire.” Et pourtant.

Quand on augmente fortement la taille du modèle, la quantité de textes utilisés pour l’entraîner, et la puissance de calcul mobilisée, ses performances progressent de façon régulière. C’est exactement ce qu’OpenAI a mis en évidence en 2020 avec ce qu’on a appelé des lois d’échelle.

L’idée derrière ces lois est simple : si on augmente ensemble plusieurs dimensions du système, les résultats s’améliorent de manière assez prévisible. Plus grand, plus de données, plus de calcul… donc, globalement, de meilleures performances. GPT-3 sert de démonstration grandeur nature de cette logique.

Pour rendre tout ça un peu plus concret, il faut parler des paramètres. Imaginez-les comme les réglages d’un instrument. Plus un instrument a de réglages, plus il peut produire des effets variés et fins.

Un modèle avec davantage de paramètres a donc beaucoup plus de possibilités pour ajuster sa manière de traiter le langage. GPT-3 en compte 175 milliards. Ce chiffre a frappé, non pas parce qu’il dit exactement ce que le modèle sait faire, mais parce qu’il représente un changement d’échelle énorme.

On reste donc dans une logique assez directe : on grossit le modèle, on augmente les données, on met plus de calcul, et les performances montent. Rien de très mystérieux jusque-là.

Et pourtant, c’est justement là que tout change.

Une fois entraîné, GPT-3 a montré des capacités que personne n’avait programmées directement. Personne ne s’était dit : “On va lui apprendre précisément à faire telle ou telle tâche, une par une.”

Par exemple, il pouvait résoudre certains problèmes d’arithmétique. Il pouvait aussi traduire des langues. Ou encore raisonner par analogie. Et cela, sans avoir été explicitement entraîné tâche par tâche.

Ce genre de comportements a introduit une idée clé : l’émergence. Avant même de chercher une définition savante, retenez simplement ceci : le modèle faisait des choses inattendues au regard de sa recette de départ.

Il restait un modèle entraîné à prédire le mot suivant. Rien de plus. Et pourtant, il semblait capable d’aller au-delà de ce que beaucoup imaginaient possible avec ce principe simple. C’est là que la surprise est née.

La surprise ne venait donc pas d’un changement complet de méthode. On n’a pas inventé une nouvelle magie. Elle venait du fait qu’en prenant une recette connue, en la poussant beaucoup plus loin, on a vu apparaître des comportements nouveaux.

Même chez OpenAI, personne n’avait prévu qu’un modèle de langage de ce type saurait faire de l’arithmétique. Et ça, c’est un signal fort.

GPT-3 a changé la perception de ce que l’IA pouvait devenir. Il a donné l’impression qu’en changeant d’échelle, on ne gagnait pas seulement en qualité, mais aussi en polyvalence. On ne faisait pas que “mieux” la même chose. On voyait apparaître d’autres choses.

Mais cette avancée a révélé une autre réalité, beaucoup plus concrète. Entraîner GPT-3 coûte plus de 10 millions de dollars. Là, on n’est plus dans une petite expérience de laboratoire que quelques chercheurs peuvent reproduire tranquillement.

On entre dans une course industrielle. Pour construire de tels modèles, il faut du capital, des données en quantité, et une infrastructure de calcul très importante. Autrement dit, cette compétition est réservée à une poignée d’acteurs seulement.

Au fond, GPT-3 a rendu visible une idée simple, mais décisive : en intelligence artificielle, grandir peut être prévisible dans ses progrès… tout en restant surprenant dans ses effets.

Et c’est précisément cette combinaison qui a fait basculer la façon dont on regarde l’IA.

Frais et marquants

Visuel pédagogique sur l’intelligence artificielle et les armes autonomes illustrant une décision critique partagée entre un humain et une machine pour interroger le contrôle humain réel
Illustration pédagogique montrant une intelligence artificielle reliée à de multiples figures humaines et à des flux de données pour expliquer que chaque réponse dépend d’un travail humain et de ressources matérielles
Illustration d’un travailleur et d’une interface d’intelligence artificielle face à face, symbolisant l’évaluation des effets de l’IA sur l’autonomie, le jugement et la créativité au travail.
New
Une
Le travail a-t-il encore un sens ?

Éthique

Formation

Illustration pédagogique montrant un cerveau humain face à des flux de données rapides symbolisant l’intelligence artificielle pour questionner la vitesse numérique et la réflexion lente.
New
Une
Ce que la vitesse nous vole

Éthique

Formation

Illustration d’un podcast pédagogique sur l’IA et la désinformation, montrant des échanges d’informations numériques et la question de la confiance dans le débat public.
Visuel pédagogique sur le transhumanisme montrant une silhouette humaine partiellement augmentée par des éléments technologiques, pour expliquer la distinction avec le posthumanisme et les enjeux d’humain jugé plus ou moins utile
New
Une
Le rêve de l’humain augmenté

Éthique

Formation

Tous les podcasts en illimité

pour 19,90€ 9,90 € le premier mois

Déja abonné ?