Google показала Gemini 3.8 Live з живим аватаром та анонсувала Gemini 4
Ілюстрація Financiero · Приватний капіталGoogle представила нові функції своєї мультимодальної ШІ-моделі Gemini, включаючи візуалізований інтерактивний аватар та вдосконалені моделі синтезу мовлення, одночасно готуючи до випуску наступне покоління — Gemini 4.
Серед ключових оновлень — Gemini 3.8 Live with Live Avatar. Ця технологія дозволяє системі не лише вести голосовий діалог, а й одночасно генерувати відеоаватар у реальному часі. Аватар здатний синхронізувати рухи губ з мовленням, імітувати природну міміку та підтримувати плавний діалог, одночасно аналізуючи візуальну інформацію. Google позиціонує цю розробку переважно для корпоративного сектору, зокрема для клієнтської підтримки та віртуальних асистентів, і вона вже доступна в Gemini Enterprise.
Важливою особливістю Live Avatar є підтримка асинхронного виконання завдань, що дозволяє аватару продовжувати взаємодію з користувачем, поки Gemini виконує фонові операції. Система також демонструє високу багатомовність, підтримуючи синхронізацію мовлення, міміки та рухів губ у 97 мовах і дозволяючи перемикатися між ними в межах однієї розмови. Компанії також можуть створювати власні аватари на основі референсних зображень через корпоративний список доступу (allowlisting).
Крім того, Google анонсувала Gemini 3.8 Flash TTS і Flash-Lite TTS — моделі для синтезу мовлення з розширеними можливостями керування голосом та інтонацією. Flash TTS дозволяє створювати унікальні голоси за текстовим описом, регулюючи їхній характер, акцент, темп та емоції. Flash-Lite TTS оптимізована для масштабних завдань, таких як дубляж та створення аудіоконтенту, пропонуючи бібліотеку з понад 2000 готових голосів та підтримку понад 100 мов і діалектів. Обидві моделі вже інтегруються в Gemini API, Google AI Studio та інші продукти.
Усі аудіо- та відеоматеріали, згенеровані за допомогою цих технологій, позначаються невидимим водяним знаком SynthID. Це інструмент призначений для ідентифікації контенту, створеного штучним інтелектом, та мінімізації ризиків його неправдивої атрибуції, що підкреслює зобов'язання Google до прозорості в генеративних ШІ.
Паралельно з цими вдосконаленнями, Google активно готує до випуску наступну флагманську модель — Gemini 4. Керівник Google DeepMind повідомив, що Gemini 4 вже перебуває на етапі постобробки (post-training), що включає фінальне доопрацювання, перевірки безпеки та налаштування поведінки. Компанія висловлює задоволення попередніми результатами і планує випустити ранню версію значно раніше кінця 2026 року, не називаючи точних дат.
Що це означає: Розробки Google у сфері ШІ свідчать про зміщення акцентів на інтерактивність та реалістичність взаємодії. Впровадження Live Avatar та розширені можливості синтезу мовлення відкривають нові горизонти для корпоративного використання, підвищуючи ефективність комунікацій та клієнтського сервісу. Одночасна робота над Gemini 4 свідчить про стратегічне інвестування в постійне покращення базових можливостей ШІ, що потенційно може призвести до якісного стрибка в продуктивності та функціоналі.
Юристи, податкові консультанти та інвестиційні радники — у каталозі Financiero.

Обговорення
Обговорення відкрите для зареєстрованих читачів. Профіль резидента для цього не потрібен.
Увійти за посиланням або через GoogleЩе немає коментарів. Почніть обговорення.