全部文章
资讯

Google I/O 2026 Gemini 音频工具更新解读

Google I/O 2026 发布的 Gemini 音频工具将重心转向语音合成。本文纠正“只有视觉更新”的误解,并给出在生产流程中测试 Gemini 3.1 Flash TTS 的具体工作流。

作者:Flixly Team2026年5月20日
Google I/O 2026 Gemini 音频工具更新解读

一句话总结

Google I/O 2026 的 Gemini 音频工具以快速 TTS 和声音克隆为核心,而不只是视觉功能。建议用 60 秒片段和 15 秒声音样本进行测试,并在每次运行前查看每分钟报价。先用文字转语音工具把同一份脚本交给 Gemini 3.1 Flash TTS,确认时间轴准确后再扩大规模。

一个常见误区是认为 Google I/O 2026 的发布只聚焦于视觉 AI 的进展。实际上,新的 Gemini 音频工具重点在于语音合成与声音克隆功能,而且能很好地与现有平台配合。

这种看法忽略了本次更新对音频输出质量和速度的提升。Google 展示了 Gemini 3.1 Flash TTS 在标准硬件上用不到四秒处理 60 秒片段。

为什么“只看视觉”抓不住重点

以往的 I/O 大会通常先展示图像模型。而 2026 年的会议却以音频基准测试开场。实时响应的延迟降到了 180 毫秒。所有输出的采样率都保持在 48 kHz。

跳过音频环节的开发者错过了集成接口。这些接口允许第三方服务调用演示中使用的同一个 endpoint。

测试新音频模型时应该怎么做

先把一段简短脚本加载到文字转语音 endpoint 中。再用 Gemini 3.1 Flash TTS 处理同一段文字,并比较文件大小。一个 30 秒的 WAV 文件大约为 1.2 MB。

接着,克隆一段 10 秒的参考声音。把克隆结果送入第二轮生成。检查输出的音高是否与源音频相差在 2% 以内。

记录消耗的积分。在大多数托管平台上,默认设置下一分钟片段的费用会在运行前报价。

如何确认设置按预期工作

同时导出原始版本和克隆版本。把它们载入音频编辑器并对齐波形。在句子边界处,重叠部分的漂移应低于 50 ms。

再用 -18 dB 混入背景音乐进行第二次测试。以 128 kbps 导出为 MP3 后,人声轨必须依然清晰可辨。

2026 更新中的具体模型示例

Gemini 3.1 Flash TTS 上线时支持英语、西班牙语和日语。它支持用 SSML 标签控制重音和停顿。

声音克隆需要一段 15 秒的干净样本。系统会返回一个有效期为 30 天的模型 ID。

音乐生成以 24 kHz 立体声运行。一段 20 秒的循环会在生成前报价,输出格式为 WAV 或 OGG。

支持的音频格式对比

格式 最大时长 码率 每分钟积分成本
WAV 120 s 48 kHz 应用内报价
MP3 180 s 128 kbps 应用内报价
OGG 90 s 96 kbps 应用内报价

在 Flixly 中的实用工作流

打开 文字转语音 页面。粘贴根据 I/O 演示笔记整理的脚本。在模型列表中选择 Gemini 3.1 Flash TTS。

生成完成后,把文件送到 声音克隆 以保持角色声音一致。之后,克隆的声音可以接入 AI 音乐生成 来制作背景配乐。

在最终视频导出时加上 自动字幕。由于 TTS 引擎会返回逐词时间戳,时间数据始终准确。

将结果与 替代方案:Gemini TTS 页面进行对比,看看托管平台的延迟差异在哪里。

正确的做法是把每个新模型当作可组合的模块,而不是孤立的新闻标题。现在就在 文字转语音 工具中实践吧。

常见问题

Gemini 3.1 Flash TTS 生成一个 60 秒片段需要多长时间?

在当前硬件上,模型约四秒即可返回一个 60 秒的文件。实时使用时,较短片段的延迟保持在 180 毫秒左右。

I/O 更新后,声音克隆需要多长的样本?

一段干净的 15 秒参考音频即可完成初次克隆。生成的模型 ID 在 30 天内有效,可多次生成而无需重新上传。

新的 Gemini 音频管线支持哪些输出格式?

支持 48 kHz 的 WAV、128 kbps 的 MP3 和 96 kbps 的 OGG。每分钟积分成本取决于所选格式,并会在生成前报价。

克隆的声音可以和生成的音乐混音吗?

可以。导出人声时比音乐底轨低 -18 dB。之后添加字幕时,合成后的文件仍会完整保留逐词时间戳。

本文提到的工具

新闻AI音频gemini文字转语音

准备好用资讯创作了吗?

直接进入 Flixly 的 AI 工作室,用 50+ 个模型试试资讯——免费上手。