۱۴۰۵ مهر ۴, شنبه
واج‌آراVAJARA

فناوری های جدید متن به گفتار

معرفی مدل‌های جدید TTS گوگل با قابلیت‌های سفارشی‌سازی

گوگل دو مدل جدید تبدیل متن به گفتار را معرفی کرده است که امکان طراحی صداهای سفارشی و تولید صوت‌های چندزبانه را فراهم می‌کند. این مدل‌ها به بهبود کیفیت و تنوع محتوای صوتی در پروژه‌های مختلف کمک خواهند کرد.

تحریریه‌ی واج‌آرا2 دقیقه مطالعه
صنعت ترجمهدستیار هوشمند + تأیید سردبیر

در تاریخ ۲۳ سپتامبر ۲۰۲۶، گوگل دو مدل جدید تبدیل متن به گفتار (TTS) را معرفی کرد که به کاربران این امکان را می‌دهد تا صداهای سفارشی طراحی کرده، صداهای موجود را تقلید کنند و صوت‌های چندزبانه را به‌صورت گسترده تولید کنند. این دو مدل تحت عناوین Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS شناخته می‌شوند و از بیش از ۱۰۰ زبان پشتیبانی می‌کنند و به بیش از ۲,۰۰۰ صدای آماده برای تولید دسترسی می‌دهند.

مدل Gemini 3.8 Flash TTS به‌عنوان مدل «خلاقانه» جدید گوگل معرفی شده و گزینه‌ای با کیفیت بالاتر نسبت به مدل دیگر است. این مدل از ۱۳۰ زبان پشتیبانی می‌کند و برای کاربردهایی نظیر کتاب‌های صوتی، روایت استودیویی، بازی‌ها و پادکست‌ها طراحی شده است. گوگل به‌ویژه به توانایی این مدل در مدیریت تلفظ‌های دشوار و لهجه‌های منطقه‌ای و اقلیت‌ها اشاره کرده و تأکید دارد که این مدل می‌تواند هویت و کیفیت صدا را در طول مکالمات طولانی حفظ کند.

مدل Gemini 3.8 Flash-Lite TTS، گزینه‌ای سریع‌تر و با هزینه کمتر است که برای تولید حجم بالای گفتار با تأخیر کم طراحی شده است. این مدل از ۱۰۱ زبان پشتیبانی کرده و برای دوبله‌های با حجم بالا، ویژگی‌های خواندن بلند، و محتوای روزمره تک‌گوینده مناسب است. هر دو مدل امکان طراحی صداهای سفارشی و تقلید صدا را فراهم می‌کنند و کاربران می‌توانند با توصیف نقش، لهجه و ویژگی‌های صوتی مورد نظر خود، صداها را ایجاد کنند.

از دیگر ویژگی‌های این مدل‌ها می‌توان به کنترل دقیق بر روی جنبه‌های مختلف صدا، از جمله لحن، احساسات و زمان‌بندی اشاره کرد. همچنین، کاربران می‌توانند صداهای خود را با استفاده از یک رکورد مرجع ۱۰ تا ۳۰ ثانیه‌ای و یک رکورد رضایت جداگانه از گوینده، تقلید کنند.

این مدل‌ها به‌تازگی در API جیمنای گوگل و Google AI Studio در دسترس قرار گرفته‌اند و به‌زودی امکان دسترسی از طریق Gemini Enterprise نیز فراهم خواهد شد. این پیشرفت‌ها نشان‌دهنده‌ی تلاش‌های گوگل برای بهبود و گسترش قابلیت‌های فناوری گفتار و تعامل صوتی در صنعت زبان است.

این برای مخاطبِ حرفه‌ای یعنی چه؟ توسعه‌های جدید در مدل‌های TTS گوگل می‌تواند فرصت‌های جدیدی برای مترجمان، ناشران و توسعه‌دهندگان محتوا فراهم کند. با توجه به قابلیت‌های سفارشی‌سازی و تولید صوت‌های چندزبانه، این فناوری می‌تواند به بهبود کیفیت و تنوع محتوای صوتی در پروژه‌های مختلف کمک کند.

از ستون‌های دیگر بخوانید

صنعت ترجمهدستیار هوشمند + تأیید سردبیر

NVIDIA و تحول محلی‌سازی زنده در صنعت رسانه

NVIDIA در IBC 2026 از روند محلی‌سازی زنده با همکاری شرکای خود رونمایی کرد. این فناوری جدید می‌تواند به بهینه‌سازی فرآیند ترجمه و دسترسی به محتوای چندزبانه در زمان واقعی کمک کند.

2 دقیقه مطالعه
زبان‌شناسیدستیار هوشمند + تأیید سردبیر

زبان‌شناسی انسان‌های اولیه: پیچیدگی یا سادگی؟

مقاله به بررسی زبان‌های انسان‌های اولیه و شباهت آن‌ها به زبان‌های مدرن می‌پردازد. تحلیل‌های زبان‌شناسی نشان می‌دهد که زبان‌ها در طول زمان ممکن است پیچیده‌تر یا ساده‌تر شوند.

2 دقیقه مطالعه
هوش مصنوعی و زباندستیار هوشمند + تأیید سردبیر

یوتیوب از دوبلاژ هوش مصنوعی در پخش زنده رونمایی کرد

یوتیوب در رویداد «ساخته‌شده در یوتیوب» اعلام کرد که در اوایل ۲۰۲۷ آزمایش دوبلاژ هوش مصنوعی را آغاز خواهد کرد. این ویژگی به تولیدکنندگان محتوا امکان می‌دهد تا گفتار خود را به زبان‌های مختلف در حین پخش زنده ترجمه کنند.

2 دقیقه مطالعه