Video Gen Now
Retour au blog

Écrire des prompts texte-vers-vidéo qui fonctionnent

Guide pratique du prompt texte-vers-vidéo : les cinq éléments indispensables, ce qu’il faut supprimer, et comment itérer à bas coût avant de rendre en 1080p.

15 juil. 2026Video Gen NowVideo Gen Now
Écrire des prompts texte-vers-vidéo qui fonctionnent

La plupart des mauvais clips générés par IA ne viennent pas du modèle. Ils viennent du prompt texte-vers-vidéo : un empilement d’adjectifs sans sujet, sans caméra et sans lumière. Les modèles sont désormais assez bons pour que le prompt soit la seule variable que vous contrôliez vraiment.

Voici la méthode que nous utilisons sur Video Gen Now, et la raison d’être de chaque élément.

Pourquoi la liste de mots-clés ne marche plus

Les modèles d’image nous ont appris à écrire comme on remplit des tags : cinematic, 8k, ultra detailed, masterpiece. Les modèles vidéo attendent autre chose, car ils doivent résoudre le temps en plus des pixels. Une liste de tags décrit à quoi ressemble une image, mais ne dit rien de ce qui se passe entre la première et la cent-vingtième frame. Le modèle invente donc le mouvement, et son invention est en général un lent zoom sur rien.

Écrivez le plan comme vous le décririez à un cadreur qui n’a jamais vu votre référence. Deux ou trois phrases valent mieux que vingt mots séparés par des virgules.

Les cinq éléments d’un plan

Tout prompt qui survit au rendu contient ces cinq éléments. S’il en manque un, le modèle comble le vide à votre place.

  1. Le sujet — une seule chose, clairement identifiée. « Un flacon de verre à facettes », pas « un produit ».
  2. L’action — ce qui change pendant le clip. La vapeur monte, une main entre dans le cadre, la pluie commence. Si rien ne change, vous payez des crédits vidéo pour une image fixe.
  3. La caméra — le mouvement et le cadrage : lent travelling avant, caméra portée qui suit, plan large fixe, vue plongeante. C’est le groupe de mots le plus rentable du prompt.
  4. La lumière — direction et qualité : une source dure venue de la gauche, lumière douce de fenêtre, néons qui bavent sur l’asphalte mouillé. C’est la lumière qui fait qu’un rendu paraît tourné plutôt que généré.
  5. Le rendu — l’étalonnage et le format : 35 mm, faible profondeur de champ, sarcelle désaturé, noir et blanc très contrasté.

Avant

flacon en verre, photo produit, cinématique, 8k, belle lumière, professionnel, ultra réaliste

Après

Un flacon de verre à facettes posé sur une pierre mouillée. La caméra avance lentement pendant qu’une source dure balaie l’étiquette et projette une longue ombre vers la droite. Noirs profonds, faible profondeur de champ, 35 mm.

Même sujet. Le second dit au modèle quand bouger, d’où vient la lumière et ce que le cadre doit dégager : il ne reste plus rien à deviner.

Ce qu’il faut supprimer

  • Les mots de résolution et de qualité. 4K, 8K, masterpiece, best quality ne servent à rien — la vraie résolution se choisit dans les réglages de rendu. Ils ne font que diluer les mots utiles.
  • Les négations. « Sans personnage, sans texte, sans flou » fait souvent apparaître ce que vous excluiez. Décrivez plutôt l’image voulue.
  • Deux plans dans un même prompt. « Elle entre, puis on coupe sur la rue » donne un morphing confus. Un prompt, un plan. Le montage vient après.
  • Les styles empilés. « Pixar croisé film noir croisé aquarelle » se moyenne en bouillie. Choisissez un seul parti pris.

Le prompt change selon le mode

Les trois modes du générateur demandent des prompts réellement différents, et c’est là que les crédits se perdent le plus souvent.

Texte vers vidéo — les cinq éléments ci-dessus, au complet. Vous décrivez une image qui n’existe pas encore : rien n’est implicite.

Image vers vidéo — décrivez uniquement le mouvement. Votre image est déjà la première frame ; redécrire la scène va contre l’image envoyée et pousse souvent le modèle à redessiner votre produit. « La caméra avance lentement, la vapeur monte de la tasse et la lumière se déplace sur la table » est un prompt complet.

Référence vers vidéo — envoyez les sujets qui doivent rester reconnaissables, puis nommez-les par leur position : « Image 1 est la femme, Image 2 est son chien. Ils traversent ensemble un jardin ensoleillé, caméra portée qui suit derrière. » C’est cet appel par numéro qui garde un visage ou un packaging cohérent tout au long du clip.

Itérer à bas coût, livrer en haute définition

Écrire un prompt, c’est itérer — et c’est en itérant que les budgets fondent. Les crédits suivent le coût GPU réel, qui dépend du nombre de pixels : le même prompt coûte donc très différemment selon l’endroit où vous le rendez.

Pour un clip de cinq secondes en 16:9 sur Seedance 2.0 :

  • 480p — environ 68 crédits
  • 720p — environ 152 crédits
  • 1080p — environ 341 crédits
  • 4K — environ 778 crédits

Soit un facteur cinq entre le brouillon et la livraison. Écrivez le prompt, testez trois ou quatre variantes en 480p jusqu’à ce que le mouvement et le cadre soient justes, puis relancez une seule fois le gagnant en 1080p. Vous dépenserez environ un tiers de ce qu’aurait coûté la même itération en pleine résolution.

Deux points connexes :

  • Le format d’image joue aussi sur le prix. À résolution égale, le 21:9 contient plus de pixels que le 1:1, donc coûte plus cher : un clip de cinq secondes en 1080p revient à environ 447 crédits en 21:9 et environ 192 en 1:1. Le vertical 9:16 et le large 16:9 coûtent la même chose, ce qui rend symétrique le rendu des deux versions d’une campagne.
  • Les rendus échoués sont remboursés. Si un job échoue, les crédits reviennent immédiatement sur votre solde et la tâche reste dans votre bibliothèque avec l’erreur, pour ajuster le prompt sans le retaper.

Questions fréquentes

Quelle longueur pour un prompt texte-vers-vidéo ?

Deux à quatre phrases. Assez pour couvrir sujet, action, caméra, lumière et rendu ; assez court pour qu’aucune consigne ne se noie. Au-delà d’environ 80 mots, les dernières propositions perdent de leur influence.

Faut-il écrire les prompts en anglais ?

Oui, autant que possible. Les modèles ont vu bien plus de données d’entraînement en anglais : un prompt anglais leur donne davantage de prise, même pour un clip sans dialogue.

Pourquoi mon clip bouge-t-il à peine ?

Vous avez presque certainement décrit une photographie. Ajoutez une action explicite et un mouvement de caméra explicite. « Plan large fixe, poussière flottant dans un rai de lumière » bouge ; « belle pièce vide, cinématique » ne bouge pas.

Puis-je réutiliser un prompt qui a marché ?

Chaque rendu est conservé avec le prompt qui l’a produit : vous pouvez réutiliser ou dériver un plan depuis votre bibliothèque au lieu de le retaper. Modifiez une seule proposition à la fois — c’est la seule façon d’apprendre ce que chaque mot fait réellement.

À retenir

  • Décrivez un plan, pas une planche d’ambiance : sujet, action, caméra, lumière, rendu.
  • Adaptez le prompt au mode — uniquement le mouvement pour l’image vers vidéo, des sujets numérotés pour la référence vers vidéo.
  • Itérez en 480p, livrez en 1080p, et laissez le remboursement absorber les échecs.

Envie d’essayer ? Ouvrez le générateur texte vers vidéo, collez l’un des prompts ci-dessus et remplacez le sujet par le vôtre. Premier rendu, premier clip.