فناوری های جدید متن به گفتار
معرفی مدلهای جدید TTS گوگل با قابلیتهای سفارشیسازی
گوگل دو مدل جدید تبدیل متن به گفتار را معرفی کرده است که امکان طراحی صداهای سفارشی و تولید صوتهای چندزبانه را فراهم میکند. این مدلها به بهبود کیفیت و تنوع محتوای صوتی در پروژههای مختلف کمک خواهند کرد.
در تاریخ ۲۳ سپتامبر ۲۰۲۶، گوگل دو مدل جدید تبدیل متن به گفتار (TTS) را معرفی کرد که به کاربران این امکان را میدهد تا صداهای سفارشی طراحی کرده، صداهای موجود را تقلید کنند و صوتهای چندزبانه را بهصورت گسترده تولید کنند. این دو مدل تحت عناوین Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS شناخته میشوند و از بیش از ۱۰۰ زبان پشتیبانی میکنند و به بیش از ۲,۰۰۰ صدای آماده برای تولید دسترسی میدهند.
مدل Gemini 3.8 Flash TTS بهعنوان مدل «خلاقانه» جدید گوگل معرفی شده و گزینهای با کیفیت بالاتر نسبت به مدل دیگر است. این مدل از ۱۳۰ زبان پشتیبانی میکند و برای کاربردهایی نظیر کتابهای صوتی، روایت استودیویی، بازیها و پادکستها طراحی شده است. گوگل بهویژه به توانایی این مدل در مدیریت تلفظهای دشوار و لهجههای منطقهای و اقلیتها اشاره کرده و تأکید دارد که این مدل میتواند هویت و کیفیت صدا را در طول مکالمات طولانی حفظ کند.
مدل Gemini 3.8 Flash-Lite TTS، گزینهای سریعتر و با هزینه کمتر است که برای تولید حجم بالای گفتار با تأخیر کم طراحی شده است. این مدل از ۱۰۱ زبان پشتیبانی کرده و برای دوبلههای با حجم بالا، ویژگیهای خواندن بلند، و محتوای روزمره تکگوینده مناسب است. هر دو مدل امکان طراحی صداهای سفارشی و تقلید صدا را فراهم میکنند و کاربران میتوانند با توصیف نقش، لهجه و ویژگیهای صوتی مورد نظر خود، صداها را ایجاد کنند.
از دیگر ویژگیهای این مدلها میتوان به کنترل دقیق بر روی جنبههای مختلف صدا، از جمله لحن، احساسات و زمانبندی اشاره کرد. همچنین، کاربران میتوانند صداهای خود را با استفاده از یک رکورد مرجع ۱۰ تا ۳۰ ثانیهای و یک رکورد رضایت جداگانه از گوینده، تقلید کنند.
این مدلها بهتازگی در API جیمنای گوگل و Google AI Studio در دسترس قرار گرفتهاند و بهزودی امکان دسترسی از طریق Gemini Enterprise نیز فراهم خواهد شد. این پیشرفتها نشاندهندهی تلاشهای گوگل برای بهبود و گسترش قابلیتهای فناوری گفتار و تعامل صوتی در صنعت زبان است.
این برای مخاطبِ حرفهای یعنی چه؟ توسعههای جدید در مدلهای TTS گوگل میتواند فرصتهای جدیدی برای مترجمان، ناشران و توسعهدهندگان محتوا فراهم کند. با توجه به قابلیتهای سفارشیسازی و تولید صوتهای چندزبانه، این فناوری میتواند به بهبود کیفیت و تنوع محتوای صوتی در پروژههای مختلف کمک کند.
از ستونهای دیگر بخوانید
NVIDIA و تحول محلیسازی زنده در صنعت رسانه
NVIDIA در IBC 2026 از روند محلیسازی زنده با همکاری شرکای خود رونمایی کرد. این فناوری جدید میتواند به بهینهسازی فرآیند ترجمه و دسترسی به محتوای چندزبانه در زمان واقعی کمک کند.
زبانشناسی انسانهای اولیه: پیچیدگی یا سادگی؟
مقاله به بررسی زبانهای انسانهای اولیه و شباهت آنها به زبانهای مدرن میپردازد. تحلیلهای زبانشناسی نشان میدهد که زبانها در طول زمان ممکن است پیچیدهتر یا سادهتر شوند.
یوتیوب از دوبلاژ هوش مصنوعی در پخش زنده رونمایی کرد
یوتیوب در رویداد «ساختهشده در یوتیوب» اعلام کرد که در اوایل ۲۰۲۷ آزمایش دوبلاژ هوش مصنوعی را آغاز خواهد کرد. این ویژگی به تولیدکنندگان محتوا امکان میدهد تا گفتار خود را به زبانهای مختلف در حین پخش زنده ترجمه کنند.