{
    "id": 143698,
    "type": "post",
    "title": "GPT-4 générera du texte, des images et même des vidéos",
    "slug": "gpt-4-generera-du-texte-des-images-et-meme-des-videos",
    "url": "https://www.ouestmedias.net/gpt-4-generera-du-texte-des-images-et-meme-des-videos.html",
    "description": "Le 9 mars 2023, un dirigeant de Microsoft Allemagne annonçait un GPT-4 capable de produire de la vidéo. Cinq jours plus tard, le modèle sortait sans la moindre...",
    "date_published": "2023-08-20T08:25:11+02:00",
    "date_modified": "2026-09-10T17:53:23+02:00",
    "language": "fr-FR",
    "categories": [
        {
            "name": "High Tech",
            "url": "https://www.ouestmedias.net/vie-pratique/high-tech/"
        }
    ],
    "tags": [],
    "word_count": 981,
    "reading_time_min": 5,
    "image": "https://www.ouestmedias.net/wp-content/uploads/2023/03/-19-scaled.jpg",
    "image_alt": "GPT 4",
    "author": {
        "name": "Delphine Macouin",
        "url": "https://www.ouestmedias.net/author/ouestmedias/",
        "bio": "Je suis particulièrement intéressée par les rubriques Amour, Lifestyle et Santé. Ce qui ne m'empêche pas de donner mon avis sur d'autres sujets !",
        "avatar": null
    },
    "content_markdown": "Le 9 mars 2023, un dirigeant de Microsoft Allemagne annonçait un GPT-4 capable de produire de la vidéo. Cinq jours plus tard, le modèle sortait sans la moindre vidéo. Retour sur l'écart entre la promesse et la livraison.\n\nLa scène se passe lors d'un événement Microsoft consacré à l'intelligence artificielle, en Allemagne, le 9 mars 2023. Andreas Braun, directeur technique de la filiale allemande, lâche devant un parterre de clients professionnels que GPT-4 arrivera la semaine suivante et qu'il sera multimodal. Le site allemand Heise rapporte ses propos dans la foulée. En quelques heures, l'information fait le tour des rédactions tech, et une phrase en particulier tourne en boucle : le nouveau modèle saurait faire de la vidéo.\n\n> \"Nous présenterons GPT-4 la semaine prochaine. Nous aurons des modèles multimodaux qui offriront des possibilités complètement différentes. Par exemple, des vidéos.\"\n\n![Écran d'ordinateur affichant une conversation avec un modèle d'intelligence artificielle](https://www.ouestmedias.net/wp-content/uploads/2023/03/-20-scaled.jpg)\n\n  **Ce qui est réellement sorti le 14 mars 2023**\n\nGPT-4 accepte des images en entrée et répond en texte. Il ne génère ni image ni vidéo. La partie vision est d'ailleurs restée en accès limité plusieurs mois après l'annonce. Sur ce point précis, la déclaration de Microsoft Allemagne était fausse.\n\n## Multimodal ne veut pas dire ce que tout le monde a compris\n\nLe mot est piégeux. Pour un chercheur, un modèle multimodal traite plusieurs types de données : du texte, des images, parfois du son. Rien n'oblige à ce que ces types de données circulent dans les deux sens. GPT-4 lit des images et écrit du texte. C'est de la multimodalité en entrée, pas en sortie.\n\nLe grand public, lui, a entendu autre chose. Après quatre mois de ChatGPT, de Midjourney et de Stable Diffusion, l'idée qu'un même outil écrive un scénario puis le filme paraissait à portée de main. La phrase d'Andreas Braun est tombée exactement dans cette attente. Elle a été lue comme une confirmation alors qu'elle décrivait, au mieux, une direction de recherche interne.\n\n## Ce que GPT-4 savait faire de neuf, concrètement\n\nLa sortie du 14 mars 2023 n'a pas été décevante pour autant, elle a simplement porté sur autre chose. La fenêtre de contexte passe à 8 000 jetons, avec une variante à 32 000, contre environ 4 000 pour la génération précédente. En pratique, cela veut dire qu'on peut lui donner un rapport de vingt pages au lieu de trois. Les scores aux examens standardisés progressent nettement, OpenAI communiquant sur un examen du barreau américain passé dans le haut du classement, là où GPT-3.5 se traînait dans les derniers déciles.\n\nLa lecture d'image, quand elle est arrivée, a servi à des choses très prosaïques : décrire une photo à une personne malvoyante, lire un tableau mal scanné, expliquer un schéma de montage. Utile, mais loin du studio de cinéma automatique.\n\n  **Le vrai saut n'était pas la vidéo**\n\nEntre GPT-3.5 et GPT-4, ce qui change au quotidien c'est la longueur des documents traités et la baisse du taux d'erreur sur les raisonnements en plusieurs étapes. Personne n'en a fait un titre, parce que ça se raconte mal.\n\n## La comparaison avec l'iPhone, et pourquoi elle est bancale\n\nMicrosoft a beaucoup répété, au printemps 2023, que ChatGPT constituait un moment comparable à la sortie de l'iPhone en 2007. La formule a du charme et elle est en partie défendable : dans les deux cas, une technologie qui existait depuis des années devient utilisable par quelqu'un qui n'y connaît rien.\n\nElle a une limite. L'iPhone faisait exactement ce qu'il annonçait, dès le premier jour, et on pouvait le vérifier en le tenant dans la main. Un modèle de langage produit des réponses dont la justesse ne se vérifie qu'après coup, souvent par quelqu'un qui connaît déjà le sujet. La confiance ne se construit pas du tout de la même façon.\n\n## La question de l'emploi, telle qu'elle se posait en 2023\n\nInterrogé sur les métiers menacés, Andreas Braun avait tenu une ligne prudente.\n\n> \"Il ne s'agit pas de remplacer des emplois, mais de réaliser des tâches répétitives d'une manière différente qu'auparavant\", a déclaré Andreas Braun.\n\nMicrosoft, dirigé par Satya Nadella, recommandait alors aux entreprises de former leurs salariés à ces outils plutôt que d'attendre. Le discours était cohérent avec la stratégie commerciale du groupe, qui s'apprêtait à intégrer ces modèles dans Word, Excel et Teams sous le nom de Copilot. Il faut le lire pour ce qu'il est : la position d'un vendeur, pas un diagnostic neutre sur le marché du travail.\n\n  **Attention aux annonces relayées de bouche à oreille**\n\nL'épisode GPT-4 est un cas d'école. Une phrase orale, prononcée hors conférence de presse, sans support écrit, reprise par des dizaines de sites en vingt-quatre heures. Avant de reprendre une caractéristique technique, cherchez la documentation officielle du produit : ici, elle contredisait la rumeur.\n\n## À qui GPT-4 a servi en pratique\n\nLes usages qui ont pris, dans les mois qui ont suivi, ne sont pas ceux qu'on listait dans les articles d'annonce. Les développeurs s'en sont emparés pour relire du code et écrire des tests, ce qui est de loin le cas d'usage le plus mesuré en gains de temps. Les traducteurs professionnels l'ont utilisé en préparation de dossier, pour dégrossir un texte technique avant de le reprendre mot à mot. Les rédacteurs, eux, ont vite compris que la génération d'article complet produit un texte identifiable en trois lignes, et que le gain se situe plutôt dans le plan, la reformulation et la relecture.\n\nQuant aux artistes et aux graphistes, cités dans toutes les listes de 2023, ils ont surtout travaillé avec des générateurs d'images dédiés. GPT-4 ne dessinait rien.\n\n  **Le réflexe qui fait la différence**\n\nSur un texte long, donnez le document d'abord et la consigne ensuite. Le modèle traite mieux une instruction placée après le matériau qu'avant. C'est un détail de manipulation, il change souvent la qualité de la réponse plus que la formulation savante du prompt.\n\nVoir également notre article [les dernières innovations de ChatGPT et de l'intelligence artificielle](https://www.ouestmedias.net/chatgpt-les-dernieres-innovations-de-lintelligence-artificielle.html)",
    "content_html": "<p>Le 9 mars 2023, un dirigeant de Microsoft Allemagne annonçait un GPT-4 capable de produire de la vidéo. Cinq jours plus tard, le modèle sortait sans la moindre vidéo. Retour sur l'écart entre la promesse et la livraison.</p>\n\n<p>La scène se passe lors d'un événement Microsoft consacré à l'intelligence artificielle, en Allemagne, le 9 mars 2023. Andreas Braun, directeur technique de la filiale allemande, lâche devant un parterre de clients professionnels que GPT-4 arrivera la semaine suivante et qu'il sera multimodal. Le site allemand Heise rapporte ses propos dans la foulée. En quelques heures, l'information fait le tour des rédactions tech, et une phrase en particulier tourne en boucle : le nouveau modèle saurait faire de la vidéo.</p>\n\n<blockquote>\"Nous présenterons GPT-4 la semaine prochaine. Nous aurons des modèles multimodaux qui offriront des possibilités complètement différentes. Par exemple, des vidéos.\"</blockquote>\n\n<p><img src=\"/wp-content/uploads/2023/03/-20-scaled.jpg\" alt=\"Écran d'ordinateur affichant une conversation avec un modèle d'intelligence artificielle\" width=\"1200\" height=\"800\"></p>\n\n<aside class=\"bluf bluf-orange\">\n<strong>Ce qui est réellement sorti le 14 mars 2023</strong>\n<p>GPT-4 accepte des images en entrée et répond en texte. Il ne génère ni image ni vidéo. La partie vision est d'ailleurs restée en accès limité plusieurs mois après l'annonce. Sur ce point précis, la déclaration de Microsoft Allemagne était fausse.</p>\n</aside>\n\n<h2>Multimodal ne veut pas dire ce que tout le monde a compris</h2>\n\n<p>Le mot est piégeux. Pour un chercheur, un modèle multimodal traite plusieurs types de données : du texte, des images, parfois du son. Rien n'oblige à ce que ces types de données circulent dans les deux sens. GPT-4 lit des images et écrit du texte. C'est de la multimodalité en entrée, pas en sortie.</p>\n\n<p>Le grand public, lui, a entendu autre chose. Après quatre mois de ChatGPT, de Midjourney et de Stable Diffusion, l'idée qu'un même outil écrive un scénario puis le filme paraissait à portée de main. La phrase d'Andreas Braun est tombée exactement dans cette attente. Elle a été lue comme une confirmation alors qu'elle décrivait, au mieux, une direction de recherche interne.</p>\n\n<h2>Ce que GPT-4 savait faire de neuf, concrètement</h2>\n\n<p>La sortie du 14 mars 2023 n'a pas été décevante pour autant, elle a simplement porté sur autre chose. La fenêtre de contexte passe à 8 000 jetons, avec une variante à 32 000, contre environ 4 000 pour la génération précédente. En pratique, cela veut dire qu'on peut lui donner un rapport de vingt pages au lieu de trois. Les scores aux examens standardisés progressent nettement, OpenAI communiquant sur un examen du barreau américain passé dans le haut du classement, là où GPT-3.5 se traînait dans les derniers déciles.</p>\n\n<p>La lecture d'image, quand elle est arrivée, a servi à des choses très prosaïques : décrire une photo à une personne malvoyante, lire un tableau mal scanné, expliquer un schéma de montage. Utile, mais loin du studio de cinéma automatique.</p>\n\n<aside class=\"bluf bluf-bleu\">\n<strong>Le vrai saut n'était pas la vidéo</strong>\n<p>Entre GPT-3.5 et GPT-4, ce qui change au quotidien c'est la longueur des documents traités et la baisse du taux d'erreur sur les raisonnements en plusieurs étapes. Personne n'en a fait un titre, parce que ça se raconte mal.</p>\n</aside>\n\n<h2>La comparaison avec l'iPhone, et pourquoi elle est bancale</h2>\n\n<p>Microsoft a beaucoup répété, au printemps 2023, que ChatGPT constituait un moment comparable à la sortie de l'iPhone en 2007. La formule a du charme et elle est en partie défendable : dans les deux cas, une technologie qui existait depuis des années devient utilisable par quelqu'un qui n'y connaît rien.</p>\n\n<p>Elle a une limite. L'iPhone faisait exactement ce qu'il annonçait, dès le premier jour, et on pouvait le vérifier en le tenant dans la main. Un modèle de langage produit des réponses dont la justesse ne se vérifie qu'après coup, souvent par quelqu'un qui connaît déjà le sujet. La confiance ne se construit pas du tout de la même façon.</p>\n\n<h2>La question de l'emploi, telle qu'elle se posait en 2023</h2>\n\n<p>Interrogé sur les métiers menacés, Andreas Braun avait tenu une ligne prudente.</p>\n\n<blockquote>\"Il ne s'agit pas de remplacer des emplois, mais de réaliser des tâches répétitives d'une manière différente qu'auparavant\", a déclaré Andreas Braun.</blockquote>\n\n<p>Microsoft, dirigé par Satya Nadella, recommandait alors aux entreprises de former leurs salariés à ces outils plutôt que d'attendre. Le discours était cohérent avec la stratégie commerciale du groupe, qui s'apprêtait à intégrer ces modèles dans Word, Excel et Teams sous le nom de Copilot. Il faut le lire pour ce qu'il est : la position d'un vendeur, pas un diagnostic neutre sur le marché du travail.</p>\n\n<aside class=\"bluf bluf-rouge\">\n<strong>Attention aux annonces relayées de bouche à oreille</strong>\n<p>L'épisode GPT-4 est un cas d'école. Une phrase orale, prononcée hors conférence de presse, sans support écrit, reprise par des dizaines de sites en vingt-quatre heures. Avant de reprendre une caractéristique technique, cherchez la documentation officielle du produit : ici, elle contredisait la rumeur.</p>\n</aside>\n\n<h2>À qui GPT-4 a servi en pratique</h2>\n\n<p>Les usages qui ont pris, dans les mois qui ont suivi, ne sont pas ceux qu'on listait dans les articles d'annonce. Les développeurs s'en sont emparés pour relire du code et écrire des tests, ce qui est de loin le cas d'usage le plus mesuré en gains de temps. Les traducteurs professionnels l'ont utilisé en préparation de dossier, pour dégrossir un texte technique avant de le reprendre mot à mot. Les rédacteurs, eux, ont vite compris que la génération d'article complet produit un texte identifiable en trois lignes, et que le gain se situe plutôt dans le plan, la reformulation et la relecture.</p>\n\n<p>Quant aux artistes et aux graphistes, cités dans toutes les listes de 2023, ils ont surtout travaillé avec des générateurs d'images dédiés. GPT-4 ne dessinait rien.</p>\n\n<aside class=\"bluf bluf-vert\">\n<strong>Le réflexe qui fait la différence</strong>\n<p>Sur un texte long, donnez le document d'abord et la consigne ensuite. Le modèle traite mieux une instruction placée après le matériau qu'avant. C'est un détail de manipulation, il change souvent la qualité de la réponse plus que la formulation savante du prompt.</p>\n</aside>\n\n<p>Voir également notre article <a href=\"/chatgpt-les-dernieres-innovations-de-lintelligence-artificielle.html\">les dernières innovations de ChatGPT et de l'intelligence artificielle</a></p>",
    "alternates": {
        "html": "https://www.ouestmedias.net/gpt-4-generera-du-texte-des-images-et-meme-des-videos.html",
        "markdown": "https://www.ouestmedias.net/gpt-4-generera-du-texte-des-images-et-meme-des-videos.md",
        "json": "https://www.ouestmedias.net/api/post/gpt-4-generera-du-texte-des-images-et-meme-des-videos.json"
    },
    "site": {
        "name": "Ouest Médias",
        "url": "https://www.ouestmedias.net/"
    },
    "license": "Reproduction autorisée avec lien vers la source."
}