كل المقالات
أخبار

تحديثات أدوات الصوت في Gemini من Google I/O 2026

تركّز أدوات الصوت الجديدة في Gemini التي أُعلن عنها في Google I/O 2026 على تركيب الكلام. يصحح هذا المقال الافتراض بأن الإعلانات كانت مرئية فقط، ويعرض سير العمل الدقيق لاختبار Gemini 3.1 Flash TTS داخل خطوط الإنتاج.

بقلم Flixly Team20 مايو 2026
تحديثات أدوات الصوت في Gemini من Google I/O 2026

باختصار

تتمحور أدوات الصوت في Gemini من Google I/O 2026 حول تحويل النص إلى كلام بسرعة واستنساخ الأصوات، لا حول المرئيات وحدها. اختبر بمقاطع مدتها 60 ثانية وعينات صوتية مدتها 15 ثانية، مع مراجعة التكلفة المعروضة لكل دقيقة قبل كل تشغيل. استخدم أداة تحويل النص إلى كلام لتمرير النص نفسه عبر Gemini 3.1 Flash TTS والتأكد من دقة التوقيت قبل التوسع.

من الأخطاء الشائعة الاعتقاد بأن إعلانات Google I/O 2026 تركز فقط على تطورات الذكاء الاصطناعي المرئي. فأدوات الصوت الجديدة في Gemini تركّز فعليًا على ميزات تركيب الكلام واستنساخ الصوت التي تتكامل جيدًا مع المنصات القائمة.

تتجاهل هذه النظرة أن التحديثات تستهدف جودة الإخراج الصوتي وسرعته. فقد عرضت Google نموذج Gemini 3.1 Flash TTS وهو يعالج مقاطع مدتها 60 ثانية في أقل من أربع ثوانٍ على عتاد قياسي.

لماذا تُخطئ النظرة المرئية وحدها الهدف

أبرزت نسخ I/O السابقة نماذج الصور أولًا. أما جلسة 2026 فافتُتحت بمقاييس أداء صوتية. انخفض زمن الاستجابة إلى 180 ميلي ثانية للردود الفورية. وبقي معدل العينات عند 48 kHz في جميع المخرجات.

فات المطورين الذين تخطّوا الجزء الصوتي نقاطُ التكامل. وهذه النقاط تتيح للخدمات الخارجية استدعاء نقطة النهاية نفسها المستخدمة في العرض التوضيحي.

ما الذي ينبغي فعله بدلًا من ذلك عند اختبار نماذج الصوت الجديدة

ابدأ بتحميل نص قصير إلى نقطة نهاية لتحويل النص إلى كلام. مرّر النص نفسه عبر Gemini 3.1 Flash TTS وقارن حجم الملف. توقّع نحو 1.2 MB لملف WAV مدته 30 ثانية.

بعد ذلك، استنسخ صوتًا مرجعيًا مدته 10 ثوانٍ. مرّر النسخة المستنسخة إلى تمريرة توليد ثانية. تحقق مما إذا كان الإخراج يحافظ على طبقة الصوت ضمن 2 بالمئة من المصدر.

قِس الرصيد المستخدم. تُعرض تكلفة مقطع مدته دقيقة واحدة بالإعدادات الافتراضية قبل التشغيل على معظم المنصات المستضافة.

كيف تتأكد من أن الإعداد يعمل كما هو مطلوب

صدّر النسختين الأصلية والمستنسخة. حمّلهما في محرر صوتي وطابق بين الموجات. يجب أن يُظهر التداخل انحرافًا أقل من 50 ms عند حدود الجمل.

أجرِ اختبارًا ثانيًا مع موسيقى خلفية ممزوجة عند -18 dB. يجب أن يبقى مسار الصوت واضحًا ومفهومًا بعد التصدير إلى MP3 بمعدل 128 kbps.

أمثلة عملية على النماذج من تحديث 2026

يدعم Gemini 3.1 Flash TTS اللغات الإنجليزية والإسبانية واليابانية عند الإطلاق. ويقبل وسوم SSML للتحكم في التوكيد والتوقفات.

يتطلب استنساخ الصوت عينة نظيفة مدتها 15 ثانية. ويُرجع النظام معرّف نموذج صالحًا لمدة 30 يومًا.

يعمل توليد الموسيقى بتردد 24 kHz ستيريو. وتُعرض تكلفة حلقة مدتها 20 ثانية قبل التوليد، ويكون الإخراج بصيغة WAV أو OGG.

مقارنة صيغ الصوت المدعومة

الصيغة أقصى مدة معدل البت تكلفة الرصيد لكل دقيقة
WAV 120 s 48 kHz تُعرض في التطبيق
MP3 180 s 128 kbps تُعرض في التطبيق
OGG 90 s 96 kbps تُعرض في التطبيق

سير عمل عملي داخل Flixly

افتح صفحة تحويل النص إلى كلام. الصق النص المُعدّ من ملاحظات العرض التوضيحي في I/O. اختر Gemini 3.1 Flash TTS من قائمة النماذج.

بعد التوليد، وجّه الملف إلى استنساخ الصوت للحفاظ على اتساق الشخصية. ويمكن بعد ذلك تمرير الصوت المستنسخ إلى توليد الموسيقى لإضافة موسيقى خلفية.

أضف ترجمة تلقائية إلى تصدير الفيديو النهائي. تبقى بيانات التوقيت دقيقة لأن محرك TTS يُرجع طوابع زمنية لكل كلمة.

قارن النتائج بصفحات بدائل: Gemini TTS لمعرفة أين يختلف زمن الاستجابة على المنصات المستضافة.

يتعامل النهج الصحيح مع كل نموذج جديد بوصفه مكوّنًا قابلًا للتركيب لا عنوانًا مستقلًا. طبّقه مباشرة في أداة تحويل النص إلى كلام.

الأسئلة الشائعة

كم يستغرق Gemini 3.1 Flash TTS لتوليد مقطع مدته 60 ثانية؟

يُرجع النموذج ملفًا مدته 60 ثانية في نحو أربع ثوانٍ على العتاد الحالي. ويبقى زمن الاستجابة قريبًا من 180 ميلي ثانية للمقاطع الأقصر أثناء الاستخدام الفوري.

ما طول العينة المطلوب لاستنساخ الصوت بعد تحديث I/O؟

تكفي عينة مرجعية نظيفة مدتها 15 ثانية للاستنساخ الأولي. ويظل معرّف النموذج الناتج نشطًا لمدة 30 يومًا ويدعم عدة عمليات توليد دون إعادة الرفع.

ما صيغ الإخراج التي يدعمها خط معالجة الصوت الجديد في Gemini؟

تتوفر صيغة WAV بتردد 48 kHz، وMP3 بمعدل 128 kbps، وOGG بمعدل 96 kbps. وتعتمد تكلفة الرصيد لكل دقيقة على الصيغة المختارة وتُعرض قبل التوليد.

هل يمكن مزج الأصوات المستنسخة مع مقاطع موسيقية مولّدة؟

نعم. صدّر الصوت عند -18 dB بالنسبة إلى مسار الموسيقى. ويحافظ الملف المدمج على الطوابع الزمنية لكل كلمة عند إضافة الترجمة لاحقًا.

الأدوات المذكورة في هذا المقال

أخبارصوت بالذكاء الاصطناعيgeminiتحويل النص إلى كلام

مقالات ذات صلة

المزيد عن أخبار من مدونة Flixly

هل أنت مستعد للإنشاء باستخدام أخبار؟

ادخل مباشرةً إلى استوديو الذكاء الاصطناعي في Flixly وجرّب أخبار مع أكثر من 50 نموذج — والبداية مجانية.

Google I/O 2026: أدوات الصوت الجديدة في Gemini | Flixly