Przedstawiamy Speak Mode: głosowe tłumaczenie AI, które mówi za Ciebie na spotkaniach
Jest taki konkretny, bolesny moment, który zna każda osoba nieposługująca się natywnie językiem wielojęzycznego spotkania. Dyskusja pędzi. Na ekranie przewijają się napisy. Rozumiesz wszystko doskonale — Gaavala od dwudziestu minut tłumaczy drugą stronę, a Ty śledzisz rozmowę słowo po słowie. Ktoś zwraca się do Ciebie i zadaje bezpośrednie pytanie.
I wtedy bariera językowa, dotąd jednokierunkowa, zamienia się w ścianę.
Znasz odpowiedź. Wiesz dokładnie, co chcesz powiedzieć. Po prostu nie potrafisz powiedzieć tego z tą samą szybkością i precyzją w roboczym języku spotkania. Wahasz się, łagodzisz, upraszczasz i ostatecznie brzmisz na mniej kompetentnego, niż jesteś. Zanim złożysz staranne zdanie, rozmowa idzie dalej.
Zbudowaliśmy Speak Mode, żeby domknąć tę pętlę. Przy włączonym Speak Mode mówisz w swoim języku, a Gaavala wypowiada Twój przetłumaczony głos z powrotem w spotkaniu. Pozostali uczestnicy słyszą płynny głos, który w czasie rzeczywistym przekazuje Twoją odpowiedź w ich języku. Przestajesz być cichą osobą w pokoju.
Ten wpis pokazuje dokładnie, co robi Speak Mode, jaki jeden przycisk nim steruje i jakie dwa gesty odczytuje, między jakimi dwoma głosami możesz wybierać — 69 presetów studyjnych albo natywnym klonem własnego głosu — oraz jakie kompromisy warto rozumieć, zanim włączysz go na rozmowie o wysokiej stawce.
Co Speak Mode faktycznie robi
Speak Mode nie jest ścieżką dubbingową nałożoną na transkrypcję. To żywy, dwukierunkowy tor głosowy, który działa równolegle do istniejącego przepływu transkrypcji w Gaavala.
Gdy uruchamiasz go w trakcie spotkania, wewnątrz Twojej przeglądarki dzieje się co następuje:
- Rozszerzenie przechwytuje dźwięk z Twojego mikrofonu — osobno od dźwięku karty, który Gaavala przechwytuje już dla strony przychodzącej.
- Ten dźwięk z mikrofonu płynie bezpośrednio do Soniox przez WebSocket w celu transkrypcji. To ten sam wzorzec połączenia prosto do Soniox, którego używa reszta Gaavala — żaden dźwięk nie dotyka naszego backendu.
- Gdy Soniox zwraca zatwierdzone tokeny w Twoim języku źródłowym, rozszerzenie grupuje je w krótkie frazy i wysyła tekst do etapu tłumaczenia Gaavala na skonfigurowany przez Ciebie język docelowy.
- Przetłumaczony tekst trafia do wybranego silnika TTS, który syntetyzuje klip głosowy.
- Ten klip trafia do rozmowy w miejsce Twojej wychodzącej ścieżki mikrofonowej, więc wszyscy słyszą przetłumaczony głos tak, jakby był Twój. Nie ma żadnego wirtualnego mikrofonu do instalowania ani niczego do wybierania w ustawieniach dźwięku Twojej aplikacji do spotkań — a gdy przetłumaczony głos gra, Twój prawdziwy mikrofon jest wyciszony, więc rozmowa nigdy nie słyszy obu naraz.
Cała pętla działa, gdy jeszcze mówisz. Zanim skończysz zdanie w swoim języku, zsyntetyzowane tłumaczenie już gra w ich. Nie czekasz na przycisk „przetłumacz". Nie robisz między myślami dłuższych pauz niż zwykle.
Jeden przycisk, który odczytuje gest
Prawdziwe spotkania nie są do siebie podobne, więc Speak Mode musi zachowywać się inaczej, gdy odbijasz jednozdaniową odpowiedź, a inaczej, gdy prowadzisz kogoś przez slajd. Większość narzędzi rozwiązuje to przełącznikiem trybu, który trzeba ustawić, zanim się go potrzebuje — co oznacza, że w chwili, gdy potrzebujesz drugiego trybu, jesteś w niewłaściwym.
Gaavala nie ma przełącznika trybu. Jest jeden przycisk Speak i to on odczytuje, jak go naciskasz.
Przytrzymaj
Przytrzymaj przycisk, a mówisz tylko tak długo, jak trzymasz. Puść, a tor zamyka się czysto. To gest krótkofalówki i jest bezpieczny: nigdy przypadkiem nie nadasz uwagi na boku, kaszlnięcia ani chwili myślenia na głos. To właściwy odruch przy szybkim wtrąceniu, przy rozmowach o wysokiej stawce, gdzie precyzja bije płynność, oraz w każdym pomieszczeniu, w którym Twój mikrofon mógłby złapać głosy, których nie zamierzałeś tłumaczyć.
Przytrzymanie działa też z klawiatury — naciśnij i utrzymaj spację przez mniej więcej jedną trzecią sekundy, a zachowa się dokładnie tak jak przytrzymanie przycisku.
Stuknij
Stuknij przycisk zamiast trzymać, a otworzy on 60-sekundowe okno bez trzymania. Pierścień odlicza to okno w minutach i sekundach, a przez ostatnie dziesięć robi się bursztynowy, więc zawsze wiesz, ile zostało Ci z kolejki, nie patrząc na zegar. Mów naturalnie; Gaavala tłumaczy i wypowiada kolejne frazy na bieżąco, a Ty niczego nie dotykasz.
Dwa szybkie stuknięcia otwierają zamiast tego okno 30-sekundowe — uczciwa długość na krótką, przygotowaną wypowiedź. Stuknij jeszcze raz w trakcie trwania okna, a zatrzyma się wcześniej; w przeciwnym razie kończy się samo na zerze.
Dlaczego to jedna kontrolka, a nie dwie
Gest, który i tak wykonujesz, koduje intencję. Krótkie naciśnięcie znaczy „tylko to", stuknięcie znaczy „daj mi chwilę". Niczego nie trzeba konfigurować z wyprzedzeniem, nic nie jest w złym trybie, gdy nadchodzi moment, i nie ma skrótu klawiszowego do przypisania ani zapomnienia. Właściwość bezpieczeństwa, którą ludzie cenili w push-to-talk — nic nie opuszcza pokoju, jeśli tego nie chciałeś — pozostaje w pełni prawdziwa przy przytrzymywaniu.
Głosy: 69 presetów studyjnych i Twój własny
Speak Mode daje Ci dwa sposoby wyboru głosu, który usłyszy spotkanie. Oba mówią wszystkimi 60 językami, na które Gaavala tłumaczy, i oba pozostają na tej samej ścieżce prosto do Soniox, z której korzysta reszta Gaavala — bez zewnętrznego dostawcy głosu w torze.
69 głosów studyjnych Soniox (domyślne w Pro)
Głosy studyjne Soniox są domyślne w Pro i dla większości osób to ustawienie, którego nigdy nie trzeba zmieniać: 69 wielojęzycznych presetów mówiących wszystkimi 60 językami, na które Gaavala tłumaczy, międzyjęzykowo, na zarządzanym kluczu — nie ma niczego do skonfigurowania. Synteza idzie prosto z przeglądarki do Soniox, z tym samym wzorcem krótkotrwałego klucza co napisy, więc przetłumaczony tekst nigdy nie przechodzi przez backend Gaavala. Opóźnienie jest strumieniowe — głos zaczyna grać, gdy tylko gotowy jest pierwszy fragment, zwykle sekundę lub dwie po zatwierdzeniu frazy.
Twój własny głos (natywny klon)
Nagraj raz w panelu bocznym około 20 sekund własnej mowy, a Gaavala zbuduje osobisty klon głosu — oparty na Soniox — który mówi tymi samymi 60 językami co głos studyjny, tyle że Twoją barwą zamiast presetu. Próbka referencyjna jest przechowywana w postaci zaszyfrowanej i możesz ją w każdej chwili usunąć z tego samego ekranu ustawień; samego dźwięku Twojego spotkania nigdy nie przechowujemy, ani w tej funkcji, ani nigdzie indziej w Gaavala.
Te dwie opcje różnią się dokładnie jednym: znajomością głosu. Głos studyjny brzmi dopracowanie i neutralnie od pierwszej sesji. Twój własny klon wymaga dwudziestu sekund konfiguracji, a potem za każdym razem brzmi nie do pomylenia jak Ty — przydatne, jeśli prowadzisz cykliczne rozmowy z tymi samymi klientami czy współpracownikami i chcesz, żeby słyszeli ten sam głos rozmowa po rozmowie.
Jak to wypada na tle tego, co już istnieje
Tłumaczenie głosowe w czasie rzeczywistym na spotkaniach od lat jest funkcją „wkrótce dostępną". Kilka rzeczy istnieje, ale żadna nie pokrywa tego samego obszaru co Speak Mode.
- Agent Microsoft Teams Interpreter. Microsoft zapowiedział agenta Interpreter dla Teams, który potrafi tłumaczyć i mówić głosem użytkownika. Działa wyłącznie w Teams. Wymaga licencji Microsoft 365 Copilot — płatnego dodatku na użytkownika doliczanego do kwalifikującego się planu bazowego — i jest zamknięty za decyzją administratorów tenanta, którzy włączyli Copilot w organizacji. Jeśli żyjesz w środowisku Teams z licencjami Copilot, to sensowna opcja. Jeśli pracujesz w Teams, Zoomie, Meet i Webexie z klientami spoza Twojego tenanta, nic Ci to nie da.
- ChatGPT Voice Mode. ChatGPT potrafi prowadzić z Tobą rozmowę głosową i potrafi tłumaczyć. Nie potrafi natomiast usiąść w Twojej rozmowie w Zoomie i mówić w Twoim imieniu do pozostałych uczestników. To osobisty chatbot głosowy, a nie agent głosowy do spotkań.
- Tłumaczone napisy w Google Meet. Google Meet ma tłumaczone napisy w czasie rzeczywistym. Są wyłącznie tekstowe. Po drugiej stronie nie ma żadnego wyjścia głosowego.
- Interprefy, KUDO i korporacyjne platformy tłumaczeniowe. To prawdziwe usługi tłumaczeniowe — w większości z udziałem ludzkich tłumaczy, czasem ze wsparciem AI — wyceniane i zorganizowane pod duże konferencje i branże regulowane. Nie jest to coś, co niezależny konsultant dokłada do rozmowy handlowej jeden na jeden.
Z tego, co widzimy, na rynku nie ma narzędzia w cenie konsumenckiej, które realizowałoby prawdziwie dwukierunkowe tłumaczenie głosowe wewnątrz platform spotkań, z których ludzie faktycznie korzystają. Speak Mode jest naszą odpowiedzią na tę lukę.
Dla kogo jest Speak Mode
Speak Mode to funkcja Pro i jest wyceniona z myślą o indywidualnych profesjonalistach, a nie o wdrożeniach korporacyjnych. Najwięcej wyciągają z niej:
- Międzynarodowi konsultanci prowadzący rozmowy projektowe z klientami o ograniczonym angielskim, którzy wolą usłyszeć Cię we własnym języku, niż mozolić się w Twoim.
- Liderzy wielojęzycznych zespołów dołączający do standupów z zespołami inżynierskimi za granicą, gdzie połowa zespołu myśli w jednym języku, a połowa w drugim.
- Handlowcy sprzedający na rynki zagraniczne, gdzie płynnie brzmiący głos w języku klienta zmienia odczucie z rozmowy i to, jak wypada oferta.
- Osoby z operacji terenowych łączące zagraniczny obiekt z centralą, gdzie stawką nieporozumienia jest sprawność operacyjna, a nie tylko dobre relacje.
Jeśli Twoje spotkania są w pełni dwujęzyczne w jednej parze i wszyscy nadążają, prawdopodobnie nie potrzebujesz Speak Mode. Jeśli powtarza się moment, w którym Ty albo ktoś po drugiej stronie milknie, bo luka językowa jest jednokierunkowa, to jest funkcja, która ten moment naprawia.
Prywatność: co się zmienia, a co nie
Podstawowa architektura prywatności Gaavala nie zmienia się, gdy włączasz Speak Mode. Przychodzący dźwięk spotkania nadal płynie bezpośrednio z Twojej przeglądarki do Soniox przez WebSocket, który nigdy nie dotyka naszego backendu. Dźwięk z Twojego mikrofonu na potrzeby Speak Mode podąża tym samym wzorcem połączenia prosto do Soniox — nigdy go nie widzimy.
Etap TTS podlega temu samemu wzorcowi przy obu opcjach głosu. Głosy studyjne Soniox wysyłają przetłumaczony tekst prosto z przeglądarki do Soniox, uwierzytelniając się tymi samymi krótkotrwałymi kluczami tymczasowymi, których używają napisy — backend Gaavala nigdy nie widzi ani tekstu, ani dźwięku. Twój własny sklonowany głos syntetyzuje się tak samo, z jednym świadomym, wąskim wyjątkiem po stronie źródłowej: próbka referencyjna trwająca ~20 sekund, którą nagrywasz, aby zbudować klon, jest przechowywana w postaci zaszyfrowanej (AES-256-GCM) na serwerach Gaavala, używana wyłącznie do zbudowania i utrzymania Twojego głosu oraz usuwana na żądanie w dowolnej chwili. Nic innego z dźwięku Speak Mode — ani wejście z Twojego mikrofonu, ani dźwięk spotkania, ani zsyntetyzowane wyjście — nie jest nigdy przechowywane.
Backend Gaavala pozostaje poza drogą dźwięku przy obu opcjach głosu. Jeśli chcesz to zweryfikować, wciąż działa ta sama sztuczka z inspekcją sieci z naszego wpisu o prywatności: otwórz DevTools dla strony w tle rozszerzenia, przefiltruj zakładkę Network, a zobaczysz bezpośrednie połączenie z Soniox — i zero ruchu audio do gaavala.com.
Jak to włączyć
Speak Mode to funkcja dostępna wyłącznie w Pro. Bezpłatna wersja próbna Gaavala (jednorazowe 5 minut, bez karty kredytowej, nigdy się nie resetuje) nie obejmuje Speak Mode, więc konfiguracja wygląda mniej więcej tak:
- Zainstaluj Gaavala z Chrome Web Store za darmo i zaloguj się.
- Przejdź na Pro z panelu bocznego — $19.99 miesięcznie, bez okresu próbnego — przejdź wyżej bezpośrednio, gdy będziesz potrzebować Speak Mode.
- Otwórz ustawienia w panelu bocznym i znajdź sekcję Speak Mode.
- Wybierz głos. Głosy studyjne Soniox są domyślne w Pro i nie wymagają konfiguracji. Jeśli chcesz mówić własnym głosem, wybierz „Clone my voice" (Sklonuj mój głos) i nagraj próbkę trwającą ~20 sekund — Gaavala zbuduje Twój klon, a Ty wybierzesz go chwilę później.
- Skonfiguruj język docelowy spotkania. Nie ma trybu przechwytywania do wybrania — przycisk Speak odczytuje Twój gest, więc niczego nie trzeba decydować z wyprzedzeniem.
Potem dołącz do spotkania. Przytrzymaj przycisk Speak, gdy chcesz powiedzieć jedną rzecz, albo stuknij go, aby otworzyć okno bez trzymania, gdy masz do wygłoszenia dłuższą wypowiedź.
Wskazówki z praktyki
Kilka praktycznych uwag z budowania i codziennego używania tej funkcji:
- Rozgrzej się przytrzymywaniem. Gdy pierwszy raz usłyszysz swój zsyntetyzowany głos w spotkaniu, poczujesz się dziwnie. Na pierwszych kilku rozmowach przytrzymuj przycisk, zanim zaczniesz stukać po okna bez trzymania. Wyczucie, kiedy zrobić pauzę, jak głośno mówić i jak przetłumaczony głos wypada po drugiej stronie, kalibruje się szybko — ale tylko wtedy, gdy panujesz nad każdą porcją.
- Klonuj wyłącznie własny głos. Przepływ nagrywania w panelu bocznym buduje klon wyłącznie z próbki, którą nagrywasz sam — przez Speak Mode nie ma ścieżki do sklonowania cudzego głosu, a krok zgody w aplikacji to odzwierciedla.
- Poinformuj, jeśli to ma znaczenie. Jeśli Twoje spotkanie ma implikacje zgodnościowe — prawne, medyczne, sprzedaż regulowana — powiedz drugiej stronie, że w rozmowie działa warstwa tłumaczenia głosowego w czasie rzeczywistym. To ta sama etykieta, co informowanie o narzędziu do transkrypcji.
- Zostaw natywny dźwięk włączony. Gaavala nadal kieruje oryginalny dźwięk spotkania do Twoich głośników. Nadal powinieneś słuchać i czytać stronę przychodzącą. Speak Mode to połowa wychodząca, a nie zamiennik rozumienia tego, co się do Ciebie mówi.
FAQ
Czy spotkanie wie, że tego używam? Nie wprost. Zsyntetyzowany głos dociera do drugiej strony tym samym kanałem mikrofonowym, którego użyłbyś sam, więc nie ma banera ani metadanych. Druga strona słyszy bardzo płynny głos i może zauważyć krótkie pauzy przed każdą odpowiedzią. Zalecamy poinformowanie o tym, gdy ma to znaczenie — zobacz uwagę o etykiecie powyżej.
Czy mogę używać własnego sklonowanego głosu? Tak — natywnie, w Pro. Nagraj próbkę trwającą ~20 sekund w ustawieniach Speak Mode w panelu bocznym, a Gaavala zbuduje oparty na Soniox klon, który wybierzesz jako swój głos w Speak Mode. Nie jest potrzebne osobne konto ani klucz API.
Jakie jest opóźnienie? Zarówno głosy studyjne, jak i Twój własny klon korzystają z tej samej strumieniowej ścieżki syntezy prosto z przeglądarki do Soniox. Licz na to, że głos zacznie grać w ciągu sekundy lub dwóch od zatwierdzenia frazy — nie czekasz, aż wyrenderuje się całe zdanie, zanim spotkanie cokolwiek usłyszy.
Co, jeśli mój język docelowy to nie angielski? Obie opcje głosu mówią już wszystkimi 60 językami, na które Gaavala tłumaczy — głosy studyjne Soniox i Twój własny klon działają tak samo niezależnie od języka docelowego, od razu po wyjęciu z pudełka.
Czy działa na spotkaniach z Teams Premium? Tak. Speak Mode działa na każdym spotkaniu, które toczy się w karcie Chrome, w tym w Microsoft Teams, Zoomie, Google Meet i Webexie. Nie ma znaczenia, czy organizator spotkania ma Teams Premium albo Copilot. Speak Mode działa po Twojej stronie rozmowy, a nie na infrastrukturze prowadzącego.
Wypróbuj
Speak Mode jest dostępny już teraz dla subskrybentów Pro. Jeśli dopiero zaczynasz z Gaavala, zacznij od jednorazowej bezpłatnej wersji próbnej — 5 minut transkrypcji, bez karty kredytowej — żeby najpierw ocenić doświadczenie tłumaczenia przychodzącego. Speak Mode nie wchodzi w skład bezpłatnej wersji próbnej; przejdź na Pro ($19.99/miesiąc, bez okresu próbnego), gdy będziesz gotowy odblokować stronę wychodzącą.
Zainstaluj Gaavala z Chrome Web Store za darmo, a potem przejdź na Pro, aby odblokować Speak Mode.