اخبار

“جذابیت فناوری: Gemini صدای شما را شبیه‌سازی کرده و فیلمنامه‌ها را با هنرمندی اجرا می‌کند!”

پیوندهای وابسته در Android Authority ممکن است برای ما پورسانت دریافت کنند. بیشتر بدانید.

فناوری عمومی

Gemini اکنون قادر است صدای شما را شبیه‌سازی کرده و مانند یک بازیگر، اسکریپت‌ها را اجرا کند. این ارتقاء شامل بیش از 2000 صدا، صحنه‌های دو بلندگو و کنترل‌های تحویل دقیق‌تر است.

به گزارش خبرنگار پایگاه خبری، Gemini 3.8 Flash TTS و Flash-Lite TTS، جدیدترین مدل‌های تبدیل متن به گفتار گوگل، صدای تولید شده با هوش مصنوعی را با کیفیت بالاتری ارائه می‌دهند. Gemini 3.8 Flash TTS می‌تواند صداهای سفارشی ایجاد کند، صدای مجاز را از یک نمونه 30 ثانیه‌ای تکرار کند و لهجه‌ها، قدم زدن، احساسات و گفتگوی دو بلندگو را کنترل کند.

این مدل‌های جدید به Gemini Notebook و Google Vids اضافه می‌شوند و هر دو از طریق Google AI Studio و Gemini API برای توسعه‌دهندگان در دسترس هستند. صداگذاران هوش مصنوعی می‌توانند یک اسکریپت را بخوانند، اما واداشتن آن‌ها به اجرای واقعی آن با لهجه، قدم زدن، احساسات، مکث‌ها و حتی آه‌های گاه به گاه، چالشی دیگر است. برای حل این مشکل، گوگل هفته‌ها وقت صرف کرده تا Gemini 3.8 را به مدل‌های Live و Live Extended Thinking جدید تبدیل کند.

اکنون گوگل می‌خواهد که این خانواده جدید نقش را بر عهده داشته باشند، با Gemini 3.8 Flash Text-to-Speech (TTS) و Flash-Lite TTS. بزرگترین تغییر برای کاربران، کنترل بیشتر است. در یک پست وبلاگی، گوگل اعلام کرد که Gemini 3.8 Flash TTS می‌تواند با پشتیبانی از بیش از 100 زبان و گویش، صدایی اصلی را از یک توصیف به زبان طبیعی ایجاد کند. کاربران همچنین بیش از 2000 صدای آماده تولید دریافت می‌کنند و تکرار صدا می‌تواند صدایی ثابت را از یک نمونه 30 ثانیه‌ای بازسازی کند، مشروط بر اینکه اجازه استفاده از آن را داشته باشند.

این قابلیت‌ها فراتر از «جای‌گذاری متن، دریافت صدا» هستند. هر دو مدل می‌توانند از دستورالعمل‌های خط به خط برای لحن، قدم زدن، تغییر گویش، نجوا، خنده، آه و سایر نشانه‌های مکالمه پیروی کنند. آن‌ها همچنین می‌توانند مکالمه‌های دو سخنران را از یک فیلمنامه اجرا کنند و صداها را در طول ساعت‌ها ثابت نگه دارند. این می‌تواند به معنای پادکست‌ها، کتاب‌های صوتی، دوبله، عوامل صوتی و ویدیوهای روایت‌شده باشد که همگی کمتر رباتیک به نظر می‌رسند.

نتایج بنچمارک گوگل نیز قوی هستند. Gemini 3.8 Flash TTS به طور کلی در معیار طراحی صوتی Hume AI، از جمله امتیاز 60.8 برای لهجه‌ها، رتبه اول را به خود اختصاص داد، در حالی که Flash و Flash-Lite دو رتبه برتر در شاخص کیفیت کلی Hume را به خود اختصاص دادند. تست‌های Voice Arena نیز آن‌ها را در چندین زبان در بالاترین سطح یا نزدیک به آن قرار می‌دهند. ElevenLabs همچنان در کیفیت صدای فردی هیوم و دسته بندی تغییرات شبیه انسان امتیاز بالاتری کسب کرد.

کاربران عادی مجبور نیستند منتظر بمانند تا هر قطعه به ابزار توسعه‌دهنده برسد. Flash TTS در Gemini Notebook در حال انتشار است، در حالی که Flash-Lite TTS در Google Vids که به تازگی آخرین تولیدکننده ویدیوی Omni خود را برای کاربران بیشتری باز کرده است، در حال عرضه است. توسعه‌دهندگان می‌توانند از طریق Gemini API و AI Studio به هر دو دسترسی داشته باشند.

گوگل همچنین نرده‌هایی را برای تکرار صدا در نظر گرفته است. این شرکت به تأیید رضایت نیاز دارد، واترمارکینگ SynthID و اعتبارنامه C2PA را اضافه می‌کند و تکرار صدای استودیوی هوش مصنوعی را در چندین منطقه از جمله بریتانیا، EEA (منطقه اقتصادی اروپا)، هند، تگزاس و ایلینوی مسدود می‌کند.

نوشته های مشابه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *