Comment faire du montage vidéo avec GPT-6 Astra et CapCut

J’ai confié trois montages à GPT-6 Astra : une vidéo face caméra, un film entièrement généré par l’IA et les meilleurs moments d’une interview. Voici mes prompts, les étapes dans CapCut et les résultats, avec leurs limites.

L'événement de la rentrée, c'est la sortie de GPT-6 Astra. Le nouveau modèle d'IA que tu peux retrouver à l'œuvre dans ton ChatGPT (ou dans "Codex" si tu fais partie des initiés).

On a beaucoup glosé sur ce nouveau modèle, le plus puissant du moment avec Claude Fable 5.1 d'Anthropic.

Jensen Huang, le patron de Nvidia, a même fait cette déclaration tonitruante qui se voulait sans doute historique :

«

L’intelligence artificielle générale est arrivée. Félicitations à l’équipe d’OpenAI.

»

L'AGI, c'est l'intelligence artificielle générale, une sorte de graal mystique qui décrit en gros une IA capable de faire tout ce qu'un humain pourrait réaliser derrière un écran.

Franchement, je ne suis pas fan de ce terme nébuleux, et je préfère l'approche d'Ethan Mollick, qui résume assez bien ce que j'en pense :

«

Sur X, on débat beaucoup pour savoir si Astra et Fable sont des intelligences artificielles générales (AGI). Le problème, c’est que le terme n’a pas de définition précise. Je veux bien admettre que nous sommes entrés dans l’ère de l’AGI si l’on parle d’une « AGI aux capacités inégales » (jagged AGI), qui dépasse l’humain moyen dans de nombreux domaines, mais reste en deçà dans d’autres. Mais est-ce vraiment de l’AGI ? Si l’on entend par là une IA qui surpasse un expert humain dans la plupart des tâches humaines, nous n’y sommes pas. Pas encore ? Il reste stupéfiant de voir le niveau atteint par l’IA et la vitesse à laquelle elle y est parvenue, moins de dix ans après l’invention du Transformer et moins de quatre ans après l’arrivée de ChatGPT (GPT-3.5).

»

De mon côté, j'ai beaucoup travaillé avec lui ces derniers jours, et je me suis surtout concentré sur un sujet qui me travaille depuis quelque temps : le montage vidéo. L'IA a toujours été un peu compliquée à piloter sur ce terrain. Et je suis nul en montage.

Astra change-t-il la donne ? Alors la réponse est oui, reste avec moi, je vais te montrer comment faire.

J’ai confié mes vidéos à GPT-6 Astra

Les principaux atouts de GPT-6 Astra sont ses bonnes capacités visuelles et son agilité dans l’utilisation de ce que l'on appelle le "Computer Use". Une technique qui permet à une IA de prendre le contrôle de ton ordinateur pour utiliser tes applications comme le ferait un collaborateur derrière ton écran. Cette méthode n'est pas nouvelle (Anthropic la proposait déjà en 2024), mais elle était un peu laborieuse.

Astra, en revanche, s'en sort très bien et peut réaliser des tâches complexes sur ton écran aussi vite qu'un humain.

Bon, pour dessiner à main levée, ce n'est pas encore ça...

Le dessin à main levée réalisé par Astra

Je me suis donc demandé s'il pourrait s'occuper du montage de mes vidéos à ma place, en utilisant CapCut, le logiciel que j'utilise habituellement et que je maîtrise, il faut l'avouer, assez mal.

1. Préparer la vidéo et donner le prompt à GPT-6

J'ai fait plusieurs tests.

J'ai ouvert l'application Codex sur mon Mac, et je l'ai fait travailler dans un dossier "video" en local.

J'ai commencé par lui demander de m'écrire un texte pédagogique à lire à haute voix sur les tokens, ces fragments de texte que les modèles manipulent. Il a fait quelques recherches, a regardé un fichier qui lui décrit mon style oral, et a pondu un texte.

Je l'ai ensuite lu à haute voix devant la caméra, en ne faisant aucun effort de cadrage, de lumière, ni de diction. Je me suis aussi volontairement trompé plusieurs fois pour qu'il coupe ces erreurs au montage.

Je me suis ensuite inspiré d'un prompt de mon ami Jean-Baptiste Berthoux que je trouvais bien tourné, et que j'ai retravaillé, pour lui donner l'instruction suivante.

Tu noteras l'utilisation du terme "/goal" qui lui donne un objectif final et lui impose de ne pas s'arrêter avant d'avoir obtenu le résultat escompté (tu peux aussi lui dire "ton objectif", Astra le comprend aussi) :

Tu es le directeur artistique et éditorial, tu coordonnes une équipe entière.
Tu recrutes et délègues tout à ton équipe. Je vais te donner un lien vers une vidéo pédagogique.
Ton /goal final : la vidéo montée via CapCut sur mon Mac et exportée sur mon bureau. La vidéo doit avoir du motion design et des titres pour faciliter la compréhension. Le montage doit être dynamique, éviter les blancs et les hésitations. Et utiliser des outils de retouche IA pour le visage, la lumière et le son.

20 minutes plus tard, j'avais la vidéo montée sur mon bureau. Non seulement il avait supprimé toutes les hésitations et erreurs, mais il avait ajouté des infographies animées ainsi que des sous-titres sans erreur de transcription.

La direction artistique n'était pas géniale (c'est peu dire), mais en même temps je ne lui avais donné aucune indication.

2. Améliorer le montage avec Remotion

Au passage, j'ai découvert un outil assez intéressant, qui permet aux agents IA de réaliser des animations pour des vidéos. Il s'appelle Remotion, et il est gratuit pour les particuliers et les entreprises jusqu’à trois salariés. Demande à ton agent de l'explorer, il pourra aussi installer une "skill" (une compétence) qui l'aidera à mieux utiliser cet outil.

Je lui ai donc demandé de "convoquer son équipe créative" pour rendre la vidéo plus pro sur l'habillage graphique, plus rythmée, et d'utiliser Remotion pour les animations.

Voir ma vidéo sur les tokens

3. Créer une vidéo faceless avec Kie AI

J'ai ensuite essayé de réaliser, à partir du même texte, une vidéo de type "faceless", c'est-à-dire "sans visage". Je voulais que les images mais aussi la voix et la musique soient entièrement générées par l'IA.

Pour cela j'ai utilisé une plateforme que je trouve très intéressante pour les agents IA : kie.ai. Elle te permet de piloter de nombreux modèles d'IA (texte, image, vidéo et son) à partir d'une connexion API, une interface par laquelle ton agent transmet directement ses demandes aux modèles.

(Si c'est trop compliqué pour toi, tu peux aussi utiliser le connecteur Higgsfield en allant dans les plugins de ChatGPT.)

J'ai ensuite amélioré le prompt précédent en lui demandant cette fois de générer la voix off avec l'IA, d'illustrer le propos par des animations imitant la pâte à modeler et de créer la musique de fond.

Astra s'est connecté à Kie AI, a choisi les modèles Gemini Omni et Seedance pour la vidéo (environ 13 plans générés), ElevenLabs pour la voix et Suno pour la musique.

Le tout m'a coûté 25 $ pour une vidéo au format TikTok de 108 secondes, dont 20 % du coût étaient consacrés aux corrections des plans ratés.

Une fois tous les morceaux générés, il a ouvert CapCut sur mon ordinateur et a commencé le montage.

Le montage de la vidéo faceless dans CapCut : plans, sous-titres, voix et musique

Temps total de l'opération : 35 minutes. Tu peux voir le résultat ici :

La vidéo sur les tokens en animation façon pâte à modeler

Sincèrement, j'ai été impressionné. Prochaine étape, lui donner une vraie direction artistique !

4. Monter les meilleurs moments d’une interview

Pour terminer, je voulais voir s'il était capable de réaliser des montages un peu plus compliqués. J'avais une longue interview sous la main (pas loin de deux heures !) et je voulais qu'il me génère une vidéo de trois minutes avec les meilleurs moments, quelques animations et des sous-titres.

17 minutes plus tard, Astra avait analysé la vidéo, transcrit et horodaté les propos pour identifier les bons passages, puis découpé et remonté 16 petits plans pour faire une vidéo. Il a décidé de choisir les moments où je parlais de l'écriture avec l'IA, effectivement les plus intéressants.

Les animations sont discrètes mais pro, et les sous-titres ne présentent aucune faute. Mieux : à un moment, je me trompe sur le prénom d'une personnalité et Astra l'a directement corrigé dans les sous-titres.

La démonstration était convaincante, mais comme souvent, le diable se cache dans les détails. Il y avait deux plans coupés un peu brutalement et un décalage entre la voix et l'image sur l'un d'eux (j'ai compris plus tard que ce décalage était dans la vidéo originale montée par... un humain).

La question était donc de savoir si ce qu'on appelle "le dernier kilomètre" (les petites retouches qui rendent le produit final publiable) n'était pas trop laborieux. Alors ça m'a pris 20 minutes de plus, mais Astra s'en est plutôt bien sorti.

Voir le montage de mon interview sur l’écriture avec l’IA

Tu peux voir le montage ici.

Et si l'interview complète t'intéresse, tu peux la trouver sur YouTube.

Ce qui fonctionne et les limites du montage avec GPT-6

Il y a d'autres moyens de faire du montage avec les agents IA. La plupart du temps, ils utilisent un logiciel open-source appelé FFmpeg. Mais le passage par CapCut rend le résultat beaucoup plus exploitable dès le premier essai (j'ai testé les deux options pour une même vidéo, et la différence de qualité était nette).

Mon opinion ? Pour les exercices de montage pur avec motion design, ces éléments graphiques animés, je pense qu'un monteur vidéo avec une expérience en infographie s'en serait beaucoup mieux sorti.

Mais ici, j'ai eu une première version en une vingtaine de minutes, et gratuitement. Pour l'interview, les retouches ont porté le total à 37 minutes. Et si je l'avais fait moi-même, n'étant pas doué en montage, j'aurais obtenu un résultat moins bon et en 10 fois plus de temps. Rien que la génération des sous-titres sans faute m'a fait gagner une bonne vingtaine de minutes.

Sur le film entièrement généré par l'IA, on est sur un autre débat. Astra a généré une vidéo de A à Z : du texte à la réalisation, sans aucune intervention de ma part.

Il manque selon moi des tas de détails pour en faire une vidéo intéressante pour les réseaux, mais c'est plus une question de direction artistique en amont que de capacités de GPT-6. Je vais creuser cet aspect et te tiendrai au courant dans les prochaines semaines !

Benoît