Tous les articles
Actualités

Google I/O 2026 : les nouveautés audio de Gemini

Les outils audio Gemini présentés à Google I/O 2026 misent sur la synthèse vocale. Cet article corrige l'idée d'annonces purement visuelles et détaille le workflow exact pour tester Gemini 3.1 Flash TTS dans des pipelines de production.

Par Flixly Team20 mai 2026
Google I/O 2026 : les nouveautés audio de Gemini

En bref

Les outils audio Gemini de Google I/O 2026 reposent sur une synthèse vocale rapide et le clonage de voix, pas seulement sur le visuel. Testez avec des clips de 60 secondes et des échantillons de voix de 15 secondes, en vérifiant le coût par minute indiqué avant chaque génération. Utilisez l'outil Synthèse vocale pour faire passer le même script dans Gemini 3.1 Flash TTS et confirmer la précision du timing avant de passer à l'échelle.

Une erreur fréquente consiste à croire que les annonces de Google I/O 2026 portent uniquement sur les avancées de l'IA visuelle. En réalité, les nouveaux outils audio Gemini mettent l'accent sur la synthèse et le clonage de voix, des fonctionnalités qui s'intègrent bien aux plateformes existantes.

Cette vision ignore que les mises à jour ciblent la qualité et la vitesse de la sortie audio. Google a montré Gemini 3.1 Flash TTS traitant des clips de 60 secondes en moins de quatre secondes sur du matériel standard.

Pourquoi la vision purement visuelle passe à côté

Les précédentes éditions d'I/O mettaient d'abord en avant les modèles d'image. La session 2026 s'est au contraire ouverte sur des benchmarks audio. La latence est descendue à 180 millisecondes pour les réponses en temps réel. La fréquence d'échantillonnage est restée à 48 kHz sur toutes les sorties.

Les développeurs qui ont sauté la partie audio ont manqué les points d'intégration. Ceux-ci permettent à des services tiers d'appeler le même endpoint que celui utilisé pendant la démo.

Que faire à la place pour tester les nouveaux modèles audio

Commencez par charger un court script dans un endpoint de synthèse vocale. Faites passer le même texte dans Gemini 3.1 Flash TTS et comparez la taille des fichiers. Comptez environ 1.2 MB pour un fichier WAV de 30 secondes.

Ensuite, clonez une voix de référence de 10 secondes. Utilisez ce clone dans une deuxième passe de génération. Vérifiez que la sortie conserve une hauteur de voix à moins de 2 pour cent de la source.

Mesurez les crédits utilisés. Sur la plupart des plateformes hébergées, le coût d'un clip d'une minute avec les réglages par défaut est indiqué avant l'exécution.

Comment vérifier que la configuration fonctionne comme prévu

Exportez la version originale et la version clonée. Chargez-les dans un éditeur audio et alignez les formes d'onde. La superposition doit montrer moins de 50 ms de décalage aux limites de phrases.

Lancez un second test avec une musique de fond mixée à -18 dB. La piste vocale doit rester intelligible après export en MP3 à 128 kbps.

Exemples concrets de modèles issus de la mise à jour 2026

Gemini 3.1 Flash TTS prend en charge l'anglais, l'espagnol et le japonais dès le lancement. Il accepte les balises SSML pour contrôler l'emphase et les pauses.

Le clonage de voix nécessite un échantillon propre de 15 secondes. Le système renvoie un ID de modèle valable 30 jours.

La génération de musique fonctionne en 24 kHz stéréo. Une boucle de 20 secondes est chiffrée avant la génération et sort en WAV ou en OGG.

Comparaison des formats audio pris en charge

Format Durée max Débit Coût en crédits par minute
WAV 120 s 48 kHz indiqué dans l'app
MP3 180 s 128 kbps indiqué dans l'app
OGG 90 s 96 kbps indiqué dans l'app

Workflow pratique dans Flixly

Ouvrez la page Synthèse vocale. Collez le script rédigé à partir des notes de la démo I/O. Sélectionnez Gemini 3.1 Flash TTS dans la liste des modèles.

Après la génération, envoyez le fichier vers Clonage de voix pour garder un personnage cohérent. La voix clonée peut ensuite alimenter Génération de musique pour la musique de fond.

Ajoutez des Sous-titres automatiques à l'export vidéo final. Le timing reste précis car le moteur TTS renvoie des horodatages mot par mot.

Comparez les résultats avec les pages Alternatives : Gemini TTS pour voir où la latence des plateformes hébergées diffère.

L'approche corrigée considère chaque nouveau modèle comme une brique modulaire plutôt que comme une simple annonce isolée. Appliquez-la directement dans l'outil Synthèse vocale.

Questions fréquentes

Combien de temps faut-il à Gemini 3.1 Flash TTS pour générer un clip de 60 secondes ?

Le modèle renvoie un fichier de 60 secondes en quatre secondes environ sur le matériel actuel. La latence reste proche de 180 millisecondes pour les segments plus courts en temps réel.

Quelle durée d'échantillon faut-il pour cloner une voix depuis la mise à jour I/O ?

Une référence propre de 15 secondes suffit pour le clonage initial. L'ID de modèle obtenu reste actif pendant 30 jours et permet plusieurs générations sans nouvel import.

Quels formats de sortie le nouveau pipeline audio Gemini prend-il en charge ?

Le WAV en 48 kHz, le MP3 en 128 kbps et l'OGG en 96 kbps sont disponibles. Le coût en crédits par minute dépend du format choisi et s'affiche avant la génération.

Peut-on mixer des voix clonées avec des musiques générées ?

Oui. Exportez la voix à -18 dB par rapport à la piste musicale. Le fichier combiné conserve les horodatages mot par mot lorsque des sous-titres sont ajoutés ensuite.

Les outils cités dans cet article

actualitésaudio iageminisynthèse vocale

Prêt à créer avec Actualités ?

Ouvrez le studio IA de Flixly et testez actualités avec plus de 50 modèles — gratuit pour commencer.