全部文章
模型评测

Gemini 3.1 Flash TTS 演示

在 Flixly 上直接体验 Gemini 3.1 Flash TTS,生成 44.1kHz 的 10 秒音频片段。了解积分消耗、导出格式,以及让 90 秒项目用不到 25 积分完成的批量设置。

作者:Flixly Team2026年4月27日
Gemini 3.1 Flash TTS 演示

一句话总结

Flixly 上的 Gemini 3.1 Flash TTS 以每 10 个词 0.8 秒的速度生成 10 秒片段。切换到 44.1kHz,提示词保持在 280 个字符以内,并以并发数 4 批量处理 90 秒音频,从而压低累计消耗。

当你需要在中午前交出五个版本时,大多数平台处理一段 20 秒的短视频旁白都要 12 秒。

慢速 TTS 的真实代价

在按顺序排队处理任务的工具上,15 个片段的批量请求累计要等待 180 秒。而 Gemini 3.1 Flash TTS 通过专用接口运行时,处理同样的工作量总共只需 28 秒。

用户反馈,与旧模型相比,每分钟音频消耗的积分大幅下降。在 128 kbps MP3 输出的直接并排测试中可以看出这一差异。

常见设置问题

许多界面的默认采样率为 24kHz,会截掉 10kHz 以上的高频。生成前请切换到 44.1kHz,以符合广播标准。

提示词长度上限为 280 个字符,超出部分会被截断。请在句子结尾处拆分较长的脚本,让每次调用都不超过上限。

在 Flixly 上运行演示

选择文字转语音工具,并在模型下拉菜单中选择 Gemini 3.1 Flash TTS。输入文本,选择一个预设音色,首次测试时将时长设为 10 秒。

单次生成会返回一个 220 kB 的文件。下载后以原速播放,检查数字和缩写词的语调。

节省时间的批量设置

  • 将并发数设为 4,同时运行四个任务。
  • 先使用 16 kHz 预览模式,再提升到完整采样率。
  • 导出为 WAV 用于剪辑,然后转换为 128 kbps 的 MP3。

这些步骤能让 90 秒项目的总积分消耗保持在较低水平。

边界情况与限制

带有明显卷舌 R 音的口音,每 60 秒片段会出现 0.3 秒的轻微时间漂移。短于 4 秒的短语有时会丢失末尾辅音。

会话超过 180 秒后,批次之间会自动触发 30 秒的冷却时间。制作系列内容时请提前规划。

可直接将输出质量与 Gemini TTS 页面对比,查看 2026 年在音高稳定性方面的更新。

模型对比表

模型 每 10 个词耗时(秒) 每分钟积分 采样率选项
Gemini 3.1 Flash TTS 0.8 应用内报价 24/44.1 kHz
Seedance 2.0 1.4 应用内报价 22/48 kHz
Veo 3.1 1.1 应用内报价 仅 44.1 kHz

下一步

现在就在文字转语音页面开始演示,运行你的第一个 10 秒测试片段。调整音色参数并重新生成,直到达到你想要的语气。

常见问题

用 Gemini 3.1 Flash TTS 生成 60 秒文件需要多少积分?

在生成之前,应用会按默认设置和 44.1kHz MP3 为 60 秒文件报价。

可以用 Gemini 3.1 Flash TTS 克隆自定义声音吗?

可以,在选择模型之前,通过声音克隆工具上传一段 30 秒的参考样本。

演示支持导出哪些文件格式?

导出格式包括 WAV、128 或 320 kbps 的 MP3,以及 48 kHz 的 OGG。

Gemini 3.1 Flash TTS 支持在一次调用中使用多个说话人吗?

它只支持单一说话人的提示词。请分别生成,再用 Lip Sync Video 工具合并音轨。

输出质量与 Kling 3.0 音频相比如何?

Gemini 3.1 Flash TTS 在英语旁白的清晰度上得分更高,而在相同积分费率下,Kling 3.0 处理背景音乐更出色。

本文提到的工具

文字转语音gemini演示音频模型评测

准备好用模型评测创作了吗?

直接进入 Flixly 的 AI 工作室,用 50+ 个模型试试模型评测——免费上手。

Gemini 3.1 Flash TTS 文字转语音演示 | Flixly