GPT-4 générera du texte, des images et même des vidéos

GPT 4

Le 9 mars 2023, un dirigeant de Microsoft Allemagne annonçait un GPT-4 capable de produire de la vidéo. Cinq jours plus tard, le modèle sortait sans la moindre vidéo. Retour sur l'écart entre la promesse et la livraison.

La scène se passe lors d'un événement Microsoft consacré à l'intelligence artificielle, en Allemagne, le 9 mars 2023. Andreas Braun, directeur technique de la filiale allemande, lâche devant un parterre de clients professionnels que GPT-4 arrivera la semaine suivante et qu'il sera multimodal. Le site allemand Heise rapporte ses propos dans la foulée. En quelques heures, l'information fait le tour des rédactions tech, et une phrase en particulier tourne en boucle : le nouveau modèle saurait faire de la vidéo.

"Nous présenterons GPT-4 la semaine prochaine. Nous aurons des modèles multimodaux qui offriront des possibilités complètement différentes. Par exemple, des vidéos."

Écran d'ordinateur affichant une conversation avec un modèle d'intelligence artificielle

Multimodal ne veut pas dire ce que tout le monde a compris

Le mot est piégeux. Pour un chercheur, un modèle multimodal traite plusieurs types de données : du texte, des images, parfois du son. Rien n'oblige à ce que ces types de données circulent dans les deux sens. GPT-4 lit des images et écrit du texte. C'est de la multimodalité en entrée, pas en sortie.

Le grand public, lui, a entendu autre chose. Après quatre mois de ChatGPT, de Midjourney et de Stable Diffusion, l'idée qu'un même outil écrive un scénario puis le filme paraissait à portée de main. La phrase d'Andreas Braun est tombée exactement dans cette attente. Elle a été lue comme une confirmation alors qu'elle décrivait, au mieux, une direction de recherche interne.

Ce que GPT-4 savait faire de neuf, concrètement

La sortie du 14 mars 2023 n'a pas été décevante pour autant, elle a simplement porté sur autre chose. La fenêtre de contexte passe à 8 000 jetons, avec une variante à 32 000, contre environ 4 000 pour la génération précédente. En pratique, cela veut dire qu'on peut lui donner un rapport de vingt pages au lieu de trois. Les scores aux examens standardisés progressent nettement, OpenAI communiquant sur un examen du barreau américain passé dans le haut du classement, là où GPT-3.5 se traînait dans les derniers déciles.

La lecture d'image, quand elle est arrivée, a servi à des choses très prosaïques : décrire une photo à une personne malvoyante, lire un tableau mal scanné, expliquer un schéma de montage. Utile, mais loin du studio de cinéma automatique.

La comparaison avec l'iPhone, et pourquoi elle est bancale

Microsoft a beaucoup répété, au printemps 2023, que ChatGPT constituait un moment comparable à la sortie de l'iPhone en 2007. La formule a du charme et elle est en partie défendable : dans les deux cas, une technologie qui existait depuis des années devient utilisable par quelqu'un qui n'y connaît rien.

Elle a une limite. L'iPhone faisait exactement ce qu'il annonçait, dès le premier jour, et on pouvait le vérifier en le tenant dans la main. Un modèle de langage produit des réponses dont la justesse ne se vérifie qu'après coup, souvent par quelqu'un qui connaît déjà le sujet. La confiance ne se construit pas du tout de la même façon.

La question de l'emploi, telle qu'elle se posait en 2023

Interrogé sur les métiers menacés, Andreas Braun avait tenu une ligne prudente.

"Il ne s'agit pas de remplacer des emplois, mais de réaliser des tâches répétitives d'une manière différente qu'auparavant", a déclaré Andreas Braun.

Microsoft, dirigé par Satya Nadella, recommandait alors aux entreprises de former leurs salariés à ces outils plutôt que d'attendre. Le discours était cohérent avec la stratégie commerciale du groupe, qui s'apprêtait à intégrer ces modèles dans Word, Excel et Teams sous le nom de Copilot. Il faut le lire pour ce qu'il est : la position d'un vendeur, pas un diagnostic neutre sur le marché du travail.

À qui GPT-4 a servi en pratique

Les usages qui ont pris, dans les mois qui ont suivi, ne sont pas ceux qu'on listait dans les articles d'annonce. Les développeurs s'en sont emparés pour relire du code et écrire des tests, ce qui est de loin le cas d'usage le plus mesuré en gains de temps. Les traducteurs professionnels l'ont utilisé en préparation de dossier, pour dégrossir un texte technique avant de le reprendre mot à mot. Les rédacteurs, eux, ont vite compris que la génération d'article complet produit un texte identifiable en trois lignes, et que le gain se situe plutôt dans le plan, la reformulation et la relecture.

Quant aux artistes et aux graphistes, cités dans toutes les listes de 2023, ils ont surtout travaillé avec des générateurs d'images dédiés. GPT-4 ne dessinait rien.

Voir également notre article les dernières innovations de ChatGPT et de l'intelligence artificielle

Résumer cet article avec :

Partager :