Gemini ajoute Veo 3 et Lyria 3 Pro : vidéo et musique générées directement dans la plateforme

Google vient de rendre Gemini sérieusement plus intéressant. Veo 3 pour la vidéo et Lyria 3 Pro pour la musique sont maintenant intégrés directement dans la plateforme, pas comme des add-ons tiers mal foutus, mais nativement, dans le même écran où tu tapes tes prompts. C’est le genre de mise à jour qui fait mal à la concurrence. ChatGPT n’a rien d’équivalent côté vidéo et musique natives. Et Gemini en profite pour marquer des points dans la guerre du multimodal. Ce que tu vas apprendre:

  • Ce que Veo 3 et Lyria 3 Pro font concrètement à l’intérieur de Gemini
  • Comment le flux de travail change quand tout est dans un seul outil
  • Où en est ChatGPT sur le multimodal, avec les chiffres réels
  • Qui a accès, à quel plan, et ce que ça coûte
  • Ce que ça vaut vraiment pour un utilisateur ordinaire, pas un ingénieur Google

Ce qui vient d’être ajouté à Gemini

Soyons clairs. L’annonce de Google, c’est pas juste un partenariat avec un outil externe. Veo 3 et Lyria 3 Pro sont maintenant des capacités natives dans l’interface Gemini. Tu restes dans la même conversation, tu changes de mode, et tu génères de la vidéo ou de la musique sans aucune redirection vers une autre plateforme. Veo 3 est le modèle de génération vidéo de Google. C’est le même modèle qui faisait tourner des têtes dans les démos de l’année passée, mais là il est accessible directement depuis ton interface Gemini habituelle. Tu prompts en langage naturel, tu obtiens une vidéo. Lyria 3 Pro, c’est l’équivalent pour la musique. Genre, style, tempo, instruments, ambiance, tout ça en langage naturel aussi. C’est le modèle musical le plus avancé de Google à date, et il arrive dans Gemini au même moment.

Diagramme éditorial : trois blocs — Texte (Gemini core), Vidéo (Veo 3) et Musique (Lyria 3 Pro) — convergent par des flèches ambrées vers un cercle central marqué « une seule conversation ».
Fig. 01 — L'intégration native selon Gemini : Veo 3 (vidéo) et Lyria 3 Pro (musique) rejoignent le texte dans un même prompt, sans passer par des outils tiers.

Ce qui change vraiment ici, c’est pas la qualité isolée des modèles. C’est que tu n’as plus à sortir de ton contexte de travail pour accéder à ces capacités. Le contexte reste ouvert, la conversation continue, tu génères ta vidéo et tu reviens à ton brief en deux clics.


Veo 3 dans Gemini : comment ça fonctionne en pratique

Le principe est simple. Tu décris ta vidéo en langage naturel dans ta conversation Gemini, tu sélectionnes le mode vidéo, et Veo 3 génère à partir de ton prompt. Tu peux itérer, affiner, et repartir sur un angle différent sans perdre le contexte de ta conversation. La génération vidéo par IA a longtemps été le terrain des outils spécialisés, Runway, Sora, Kling. Chacun avec son interface, son compte à créer, ses crédits à acheter. Le passage entre un brief texte dans ChatGPT et une vidéo dans Runway, c’est une friction réelle qui ralentit les créatifs qui travaillent vite. Veo 3 dans Gemini coupe cette friction. Tu restes dans ta conversation, tu gardes ton fil de travail. Si tu construis un pitch deck avec Gemini et que tu veux une vidéo d’intro, tu le demandes dans le même chat. Le contexte de ta demande est déjà là.

Maquette au trait de l'interface Gemini avec un lecteur vidéo intégré dans la conversation et un sélecteur de mode en bas.
Schéma d'interface : la réponse de Gemini s'affiche sous forme de lecteur vidéo dans le fil, et le sélecteur de mode (texte, image, vidéo, musique) reste accessible sous la zone de prompt.

La qualité de Veo 3 sur les critères habituels de la génération vidéo : cohérence de mouvement, rendu de visages, gestion de la lumière, c’est parmi ce qui se fait de mieux côté grands modèles en 2026. Google a mis des années à affiner ce modèle avant de l’intégrer dans Gemini. Cela dit, les limites classiques de la génération vidéo s’appliquent toujours : les mains restent difficiles, les textes dans les vidéos peuvent être incohérents, les scènes très complexes avec plusieurs sujets en mouvement sont encore un défi. Ce sont des limites du domaine, pas spécifiques à Veo 3.

Lyria 3 Pro : génération musicale intégrée, pas un plugin externe

La musique, c’était encore plus fragmenté que la vidéo. Suno, Udio, Soundraw, ElevenLabs Music, des outils corrects, mais encore une fois, autant d’interfaces à gérer, autant de frictions dans le workflow. Lyria 3 Pro change ça pour les utilisateurs Gemini. Tu décris le son que tu veux. Style, tempo, humeur, instruments, durée. Lyria 3 Pro génère une piste musicale directement dans ta conversation. Tu peux itérer sur la description, demander une version plus rapide, plus sombre, plus minimaliste. Tout ça en langage naturel, sans interface spécialisée.

Schéma comparatif du workflow créatif avant et après Gemini : cinq outils séparés en chaîne (ChatGPT, Runway, Suno, export, montage) contre une interface unique Gemini intégrant texte, Veo 3 vidéo et Lyria 3 Pro musique.
Avant : cinq étapes, quatre outils, assemblage manuel et copier-coller entre plateformes. Après : une seule fenêtre Gemini, trois modes natifs (texte, Veo 3, Lyria 3 Pro) qui s'appellent entre eux sans quitter le prompt.

Ce qui est intéressant avec Lyria 3 Pro, c’est la granularité du contrôle. Tu n’es pas limité à « jazz » ou « hip-hop ». Tu peux décrire une ambiance précise, une progression émotionnelle, un registre instrumental spécifique. Le modèle comprend le langage musical descriptif même si tu n’es pas musicien.

Lyria 3 Pro n’est pas là pour remplacer un compositeur professionnel. Mais pour les créateurs de contenu, les marketeurs, les développeurs qui ont besoin d’une piste d’ambiance sans droits d’auteur pour une démo ou un prototype, c’est un gain de temps réel. Et le fait que ça reste dans Gemini, c’est pas anodin. La question des droits sur les outputs musicaux générés par IA reste un sujet légal actif en 2026. Google a des politiques d’usage sur ce point, mais comme pour tout contenu généré, tu dois vérifier ce que tu peux commercialiser avant de partir en production avec une piste Lyria.

Maquette au trait d'une conversation Gemini : prompt musical descriptif suivi d'une piste audio générée avec lecteur, forme d'onde et contrôles d'export.
Dans Gemini, le prompt musical et la piste générée par Lyria 3 Pro cohabitent dans le même fil : lecteur intégré, forme d'onde, export direct — le multimodal devient natif, pas bricolé.

Comparaison avec ChatGPT : où en est la concurrence sur le multimodal

Le truc c’est que ChatGPT et Gemini jouent dans des lignes différentes en ce moment. Sur le texte et le code, GPT-5.4 reste fort : il score à 71,7% sur SWE-bench Verified, contre 63,8% pour Gemini 3.1 Pro. Ce n’est pas une mince affaire si tu travailles principalement sur du code. Mais sur le multimodal, Gemini prend une avance que ChatGPT n’a pas encore comblée. Gemini génère maintenant du texte, de l’image, de la vidéo, et de la musique dans une seule interface native. ChatGPT peut générer des images via DALL-E intégré, mais la vidéo et la musique natives? Pas encore là.

Capacité Gemini ChatGPT
Texte et raisonnement Fort (Gemini 3.1 Pro) Fort (GPT-5.4)
Génération d'images Oui (Imagen) Oui (DALL-E)
Génération vidéo native Oui (Veo 3) Non
Génération musicale native Oui (Lyria 3 Pro) Non
Output tokens 65 000 32 000
Avantage tarifaire API Référence 20 à 60% plus cher

Gemini a aussi une longueur d’avance sur les tokens de sortie : 65 000 tokens d’output contre 32 000 pour ChatGPT. Pour les tâches longues, les documents volumineux, les outputs complexes, c’est un avantage concret. Et sur le benchmark ARC-AGI-2 qui teste le raisonnement général, Gemini score à 77,1% contre 73,3% pour GPT-5.4. Le portrait global : sur le code seul, ChatGPT garde un avantage. Sur la portée multimodale et le volume d’output, Gemini avance plus vite. La croissance de Gemini à 200% année sur année sur le trafic suggère que les utilisateurs commencent à remarquer la différence.

Soyons honnêtes aussi : ChatGPT reste la référence en termes d’adoption brute, avec 5,8 milliards de visites mensuelles contre 1,8 milliard pour Gemini. L’écart de notoriété est encore réel. Mais le ratio se resserre, et les ajouts comme Veo 3 et Lyria 3 Pro accélèrent cette dynamique.

Qui a accès et à quel prix

Là, c’est là que ça devient important pour toi, en tant qu’utilisateur québécois. Les plans Gemini sont tarifés en USD, ce qui veut dire que le taux de change entre en jeu. Le plan gratuit de Gemini (0 $US/mois) donne accès aux fonctionnalités de base, mais Veo 3 et Lyria 3 Pro ne seront probablement pas disponibles à ce niveau. Ces capacités demandent des ressources de calcul significatives.

Plan Gemini Prix Accès Veo 3 / Lyria 3 Pro
Free 0 $US/mois Peu probable ou limité
AI Plus 8 $US/mois À confirmer dans la doc Google
AI Pro 20 $US/mois Accès attendu
AI Ultra 255 $US/mois Accès complet attendu

Le plan AI Pro à 20 $US/mois est le niveau où tu peux raisonnablement t’attendre à avoir accès à Veo 3 et Lyria 3 Pro avec des quotas utilisables. Le plan AI Ultra à 255 $US/mois, c’est pour les usages intensifs ou les équipes qui veulent des limites de génération élevées. Je dis « à confirmer » parce que Google n’a pas encore publié de documentation exhaustive sur les limites de génération par plan au moment de cette mise à jour. Ce qui est standard dans l’industrie : les premiers jours d’un lancement, les détails de quotas arrivent après l’annonce. Vérifie dans la documentation officielle Gemini avant de t’abonner si les limites de génération vidéo sont critiques pour toi.

Pour les utilisateurs québécois, le taux de change est un facteur réel. Le plan AI Pro à 20 $US/mois reste compétitif si tu remplaces deux ou trois abonnements séparés (outil vidéo, outil musical, assistant IA) par une seule plateforme. Fais le calcul pour ton usage spécifique.


Ce que ça vaut vraiment pour l’utilisateur ordinaire

OK check ça. Les annonces Google sont toujours impressionnantes. Le démo sur scène, les visuels soignés, les cas d’usage parfaits. La vraie question, c’est : est-ce que Veo 3 et Lyria 3 Pro dans Gemini changent quelque chose pour la personne qui utilise l’outil dans son travail quotidien, pas dans une démo contrôlée? La réponse honnête : ça dépend de ton profil d’usage. Si tu crées du contenu régulièrement et que tu jonglais déjà entre plusieurs outils pour assembler du texte, de la vidéo, et de la musique, oui, l’intégration native est un gain réel. Pas dans la qualité brute de chaque modèle, mais dans le temps et l’attention que tu récupères en supprimant les frictions entre les outils.

Carte conceptuelle en étoile montrant Gemini au centre relié à quatre cas d'usage : créateur, marketeur, développeur, communicant.
Quatre métiers, un même atelier : Veo 3 et Lyria 3 Pro intégrés dans Gemini permettent au créateur de produire vidéos et musiques d'ambiance, au marketeur de prototyper des campagnes, au développeur de scénariser ses démos et au communicant de condenser l'information en séquences visuelles.

Si tu utilises Gemini principalement pour du texte et du code, Veo 3 et Lyria 3 Pro sont des bonus sympas, mais ils ne changent pas fondamentalement ta proposition de valeur. Tu n’as pas besoin de monter de plan si ton usage actuel ne génère pas de contenu audio-visuel. Le hic, c’est qu’on est encore au stade de l’annonce. La vraie évaluation se fait dans les semaines qui suivent le lancement, quand les limites de quota sont connues, quand les utilisateurs testent hors des conditions idéales de démo, et quand on voit si Google maintient la qualité sous charge réelle. Les sorties Google ont historiquement eu des écarts entre la démo et la version déployée. Ce lancement ne fait pas exception à la règle de prudence. Sur le benchmark de raisonnement, Gemini 3.1 Pro est fort : 77,1% sur ARC-AGI-2. Sur le code, GPT-5.4 garde l’avantage avec 71,7% sur SWE-bench contre 63,8% pour Gemini. Ces chiffres ne changent pas avec l’ajout de Veo 3 et Lyria 3 Pro, mais ils mettent en perspective ce que Gemini est vraiment : une plateforme multimodale large, pas nécessairement le meilleur choix si ton seul besoin est l’assistance au code.

Matrice 2x2 avec axes budget et usage, positionnant Gemini AI Pro dans le quadrant créatif à budget modéré et ChatGPT GPT-5.4 dans le quadrant technique à performance élevée.
Cartographie éditoriale : Gemini AI Pro s'installe côté création multimodale (vidéo Veo 3, musique Lyria 3 Pro) à budget contenu, tandis que ChatGPT GPT-5.4 domine le versant technique haute performance. Deux outils complémentaires plutôt que rivaux frontaux.

Verdict : ce qu’il faut retenir

Gemini prend une avance réelle sur le multimodal. Veo 3 et Lyria 3 Pro intégrés nativement, c’est pas une feature gadget. C’est une réponse directe à un problème réel : la fragmentation des outils créatifs. ChatGPT reste plus fort sur le code, avec GPT-5.4 à 71,7% sur SWE-bench contre 63,8% pour Gemini 3.1 Pro. Et l’API de ChatGPT est 20 à 60% plus chère selon les usages. Ces deux réalités coexistent. Il n’y a pas d’outil parfait, il y a des outils adaptés à des profils. Si tu crées du contenu, que tu jonglais entre Runway, Suno, et ton assistant IA, et que tu veux consolider sans perdre en qualité, Gemini AI Pro à 20 $US/mois mérite un test sérieux dès maintenant. Commence par le plan gratuit pour tester l’interface, puis monte si les limites de génération sont trop serrées pour ton usage. Confirme les limites de quota dans la doc officielle avant de faire le saut. Pas parce que Veo 3 ou Lyria 3 Pro ne fonctionnent pas, mais parce que les détails de déploiement sur les plans de prix arrivent toujours après l’annonce. Le produit est là. Les détails d’accès exact, vérifie-les avant de décider. Le verdict est clair : sur le multimodal, Gemini vient de creuser l’écart. La question maintenant, c’est de voir si Google maintient la qualité à l’échelle.

On continue à la Taverne ?

Un courriel par semaine. Pas de fluff.

En t'abonnant, tu reçois Le Tour de Table chaque semaine. Tu peux te désabonner en un clic. Voir notre politique de confidentialité.

Texte par David Cyr