Gemini Transcribe розпізнає професійну лексику та прибирає слова-паразити під час створення транскрипцій
- Ярослава Несисюк

- 57 хвилин тому
- Читати 2 хв

Google представила Gemini 3.5 Transcribe — нову модель для розшифрування аудіо. Вона підтримує понад 85 мов, може враховувати спеціалізовану лексику та автоматично редагувати отриманий текст. Модель також розрізняє до трьох людей у попередньо записаному аудіо.
Gemini адаптує розшифрування під потрібну лексику
Gemini 3.5 Transcribe стала новою моделлю сімейства Gemini Audio. Google називає її значним кроком уперед порівняно з попередньою моделлю Chirp 3.
Одна з головних можливостей — робота зі спеціалізованою термінологією. Користувач може заздалегідь передати Gemini власний словник із потрібними словами.
Модель враховуватиме їхнє написання під час розшифрування. Це може бути корисно для професійних термінів та іншої лексики, яку звичайне розпізнавання мовлення передає неправильно.
Gemini 3.5 Transcribe також додає режим Smart trsnscription, який автоматично форматує отриманий текст і може прибирати слова-паразити на кшталт «ем» та «е-е». В такому режимі ШІ виділяє тільки ключову думку.
Редагувати текст можна голосом. Google описує цю можливість як спосіб природно вносити зміни без ручного виправлення транскрипції.
Для записів із кількома учасниками модель може визначати, кому належать окремі репліки. Функція підтримує до трьох людей у попередньо записаному аудіо. В експериментальному режимі штучний інтелект може розпізнавати і більшу кількість людей, проте з меншою точністю.
Також Gemini може додавати часові позначки для окремих слів.
Модель розпізнає понад 85 мов
Gemini 3.5 Transcribe підтримує розпізнавання понад 85 мов. Водночас у застосунку Gemini для macOS запуск функції починається з англійської. На Android вона з’являється через Rambler лише в окремих країнах і для окремих мов.
Розробники можуть протестувати Gemini 3.5 Transcribe через Gemini API. Модель доступна в режимі публічного попереднього перегляду через AI Studio та Antigravity.
Підтримку Chrome компанія планує додати пізніше.
Gemini 3.5 Live поки не запускають
Спочатку Google також повідомила про оновлення Gemini 3.5 Live та 3.5 Live Experimental. Однак після публікації матеріалу компанія уточнила, що ці моделі поки не запускаються. Нової дати їхнього виходу Google не назвала.
В майбутньому Gemini 3.5 Live краще працюватиме з перериваннями посеред речення, визначенням мов та обробкою візуальної інформації в реальному часі.
Gemini 3.5 Live Experimental пояснюватиме перебіг своєї роботи в реальному часі під час виконання складніших завдань.




