“جذابیت فناوری: Gemini صدای شما را شبیهسازی کرده و فیلمنامهها را با هنرمندی اجرا میکند!”

پیوندهای وابسته در Android Authority ممکن است برای ما پورسانت دریافت کنند. بیشتر بدانید.
فناوری عمومی
Gemini اکنون قادر است صدای شما را شبیهسازی کرده و مانند یک بازیگر، اسکریپتها را اجرا کند. این ارتقاء شامل بیش از 2000 صدا، صحنههای دو بلندگو و کنترلهای تحویل دقیقتر است.
به گزارش خبرنگار پایگاه خبری، Gemini 3.8 Flash TTS و Flash-Lite TTS، جدیدترین مدلهای تبدیل متن به گفتار گوگل، صدای تولید شده با هوش مصنوعی را با کیفیت بالاتری ارائه میدهند. Gemini 3.8 Flash TTS میتواند صداهای سفارشی ایجاد کند، صدای مجاز را از یک نمونه 30 ثانیهای تکرار کند و لهجهها، قدم زدن، احساسات و گفتگوی دو بلندگو را کنترل کند.
این مدلهای جدید به Gemini Notebook و Google Vids اضافه میشوند و هر دو از طریق Google AI Studio و Gemini API برای توسعهدهندگان در دسترس هستند. صداگذاران هوش مصنوعی میتوانند یک اسکریپت را بخوانند، اما واداشتن آنها به اجرای واقعی آن با لهجه، قدم زدن، احساسات، مکثها و حتی آههای گاه به گاه، چالشی دیگر است. برای حل این مشکل، گوگل هفتهها وقت صرف کرده تا Gemini 3.8 را به مدلهای Live و Live Extended Thinking جدید تبدیل کند.
اکنون گوگل میخواهد که این خانواده جدید نقش را بر عهده داشته باشند، با Gemini 3.8 Flash Text-to-Speech (TTS) و Flash-Lite TTS. بزرگترین تغییر برای کاربران، کنترل بیشتر است. در یک پست وبلاگی، گوگل اعلام کرد که Gemini 3.8 Flash TTS میتواند با پشتیبانی از بیش از 100 زبان و گویش، صدایی اصلی را از یک توصیف به زبان طبیعی ایجاد کند. کاربران همچنین بیش از 2000 صدای آماده تولید دریافت میکنند و تکرار صدا میتواند صدایی ثابت را از یک نمونه 30 ثانیهای بازسازی کند، مشروط بر اینکه اجازه استفاده از آن را داشته باشند.
این قابلیتها فراتر از «جایگذاری متن، دریافت صدا» هستند. هر دو مدل میتوانند از دستورالعملهای خط به خط برای لحن، قدم زدن، تغییر گویش، نجوا، خنده، آه و سایر نشانههای مکالمه پیروی کنند. آنها همچنین میتوانند مکالمههای دو سخنران را از یک فیلمنامه اجرا کنند و صداها را در طول ساعتها ثابت نگه دارند. این میتواند به معنای پادکستها، کتابهای صوتی، دوبله، عوامل صوتی و ویدیوهای روایتشده باشد که همگی کمتر رباتیک به نظر میرسند.
نتایج بنچمارک گوگل نیز قوی هستند. Gemini 3.8 Flash TTS به طور کلی در معیار طراحی صوتی Hume AI، از جمله امتیاز 60.8 برای لهجهها، رتبه اول را به خود اختصاص داد، در حالی که Flash و Flash-Lite دو رتبه برتر در شاخص کیفیت کلی Hume را به خود اختصاص دادند. تستهای Voice Arena نیز آنها را در چندین زبان در بالاترین سطح یا نزدیک به آن قرار میدهند. ElevenLabs همچنان در کیفیت صدای فردی هیوم و دسته بندی تغییرات شبیه انسان امتیاز بالاتری کسب کرد.
کاربران عادی مجبور نیستند منتظر بمانند تا هر قطعه به ابزار توسعهدهنده برسد. Flash TTS در Gemini Notebook در حال انتشار است، در حالی که Flash-Lite TTS در Google Vids که به تازگی آخرین تولیدکننده ویدیوی Omni خود را برای کاربران بیشتری باز کرده است، در حال عرضه است. توسعهدهندگان میتوانند از طریق Gemini API و AI Studio به هر دو دسترسی داشته باشند.
گوگل همچنین نردههایی را برای تکرار صدا در نظر گرفته است. این شرکت به تأیید رضایت نیاز دارد، واترمارکینگ SynthID و اعتبارنامه C2PA را اضافه میکند و تکرار صدای استودیوی هوش مصنوعی را در چندین منطقه از جمله بریتانیا، EEA (منطقه اقتصادی اروپا)، هند، تگزاس و ایلینوی مسدود میکند.





