Google rozwija sztuczną inteligencję, która ma nie tylko słyszeć, co mówimy, ale również rozumieć wypowiedź w trudnych warunkach. Gemini 3.5 Transcribe to nowy model speech-to-text zaprojektowany do transkrypcji w czasie rzeczywistym. Ma radzić sobie z hałasem w tle, różnymi akcentami, specjalistycznym słownictwem, zmianą języka podczas rozmowy i naturalnymi błędami pojawiającymi się w mowie.
Nowy system idzie jednak o krok dalej niż klasyczne zamienianie głosu na tekst. Gemini 3.5 Transcribe może automatycznie usuwać zająknięcia i słowa-wypełniacze, rozpoznawać poprawki wypowiadane przez użytkownika oraz formatować gotową transkrypcję tak, aby przypominała normalnie napisany tekst. Google chce wykorzystać tę technologię m.in. w Gemini, Androidzie, Chrome oraz aplikacjach tworzonych przez zewnętrznych deweloperów.
Warto wiedzieć:
- Gemini 3.5 Transcribe został zaprezentowany przez Google 26 sierpnia 2026 roku.
- Model jest przeznaczony zarówno do transkrypcji na żywo, jak i analizy wcześniej nagranych plików audio.
- Google deklaruje skuteczne działanie również w środowiskach z hałasem w tle.
- Model automatycznie wykrywa język i obsługuje ponad 85 języków oraz wariantów językowych, w tym język polski.
- Potrafi usuwać „yyy”, „eee”, powtórzenia i poprawki pojawiające się podczas naturalnego mówienia.
- Gemini 3.5 Transcribe może rozpoznawać poszczególnych rozmówców oraz tworzyć znaczniki czasu dla pojedynczych słów.
- Google podaje, że czas potrzebny do uzyskania końcowej transkrypcji poprawił się o około 70 proc. względem wcześniejszego rozwiązania Chirp 3.
Gemini 3.5 Transcribe ma rozumieć mowę w trudnych warunkach
Jednym z największych problemów systemów rozpoznawania mowy pozostają warunki, które dla człowieka są zupełnie naturalne: rozmowa w samochodzie, zatłoczonym pomieszczeniu, kawiarni czy podczas spotkania, na którym kilka osób mówi jednocześnie. W takich sytuacjach klasyczne systemy speech-to-text mogą gubić fragmenty wypowiedzi, mylić słowa lub całkowicie błędnie interpretować zdania.
Gemini 3.5 Transcribe został przygotowany właśnie z myślą o bardziej realistycznym środowisku. Google deklaruje, że model dobrze radzi sobie z szumem tła, różnymi akcentami oraz wypowiedziami zawierającymi nietypowe określenia. W testach przywoływanych przez firmę średni wskaźnik błędów słów, czyli WER (Word Error Rate), wynosił 4 proc. dla transkrypcji strumieniowej oraz 2,6 proc. dla materiałów przetwarzanych poza trybem live. Wyniki mogą oczywiście zależeć od jakości nagrania, języka i charakteru rozmowy.
Google zwraca uwagę również na prawidłowe rozpoznawanie ciągów liter i cyfr, takich jak numery zamówień, kody pocztowe czy inne identyfikatory. To szczególnie istotne w przypadku systemów obsługi klienta, call center i agentów głosowych, gdzie pojedyncza błędnie zapisana cyfra może całkowicie zmienić znaczenie informacji.
AI nie tylko zapisuje głos. Potrafi od razu poprawić tekst
Najciekawszą funkcją Gemini 3.5 Transcribe może okazać się tzw. Smart transcription. W tym trybie model nie traktuje wypowiedzi wyłącznie jako ciągu słów, które należy przepisać jeden do jednego. Próbuje zrozumieć sposób, w jaki człowiek naturalnie formułuje swoje myśli, a następnie zamienia je na czytelny tekst.
Jeżeli użytkownik powie na przykład: „spotkajmy się we wtorek… nie, jednak w środę o drugiej”, system może od razu przygotować poprawioną wersję zdania dotyczącą spotkania w środę. Usuwane mogą być także typowe wypełniacze pojawiające się podczas mówienia, powtórzenia, falstarty czy zająknięcia. Model automatycznie dodaje również interpunkcję, poprawia wielkość liter i może organizować wypowiedź w akapity lub listy.
To istotna różnica względem klasycznego dyktowania. Użytkownik nie musi już mówić w sposób przypominający czytanie wcześniej przygotowanego tekstu. Może formułować myśli swobodnie, poprawiać się podczas wypowiedzi i zmieniać zdanie, a system ma samodzielnie przygotować z tego czytelny zapis.
Jednocześnie Google pozostawia możliwość korzystania z trybu verbatim, który zachowuje wypowiedź w bardziej dosłownej formie, wraz z powtórzeniami i charakterystycznymi elementami mowy. Może być on potrzebny np. podczas przygotowywania dokładnych zapisów wywiadów.
Gemini 3.5 Transcribe rozpoznaje języki, rozmówców i specjalistyczne słownictwo
Google mocno rozwija również wielojęzyczność nowego modelu. Gemini 3.5 Transcribe potrafi automatycznie wykrywać język rozmowy i obsługuje ponad 85 języków oraz wariantów regionalnych. Na oficjalnej liście znajduje się także język polski. Co ważne, system został zaprojektowany tak, aby reagować na zmianę języka nawet podczas jednej rozmowy bez konieczności ręcznego przełączania ustawień.
Model pozwala także podpowiedzieć mu specjalistyczne słownictwo. Deweloper może przekazać listę nietypowych nazw własnych, akronimów, marek czy terminów branżowych. Dzięki temu rozwiązanie wykorzystywane np. w medycynie, IT, finansach lub przemyśle nie musi polegać wyłącznie na standardowym słowniku. API pozwala przekazać nawet do 1000 takich terminów, choć Google zaznacza, że najlepsze rezultaty zazwyczaj uzyskuje się przy krótszych, starannie dobranych listach.
Przydatną funkcją jest również diarization, czyli rozdzielanie wypowiedzi poszczególnych rozmówców. API technicznie obsługuje do ośmiu osób, choć Google określa rozpoznawanie trzech lub większej liczby rozmówców jako funkcję eksperymentalną. System może ponadto przypisywać dokładne znaczniki czasu do poszczególnych słów. To otwiera drogę do automatycznego opracowywania spotkań, podcastów, rozmów telefonicznych czy materiałów wideo.
Transkrypcja ma działać niemal w czasie rzeczywistym
Gemini 3.5 Transcribe występuje w dwóch głównych wariantach. gemini-3.5-transcribe-live jest przeznaczony do ciągłego przetwarzania strumienia audio przez Live API. Google deklaruje w tym przypadku opóźnienie poniżej sekundy, dzięki czemu rozwiązanie może być stosowane w aplikacjach wymagających natychmiastowej reakcji – od napisów generowanych na żywo po rozbudowanych asystentów i agentów głosowych.
Drugi wariant, gemini-3.5-transcribe, został przygotowany do analizy nagranych wcześniej materiałów. Mogą to być rozmowy telefoniczne, wywiady, spotkania czy inne pliki audio. Google podaje, że w porównaniu z wcześniejszym modelem Chirp 3 czas potrzebny do uzyskania końcowej transkrypcji poprawił się o około 70 proc.
Znaczenie ma jednak nie tylko szybkość. Rozwój modeli takich jak Gemini 3.5 Transcribe pokazuje, że interfejs głosowy staje się dla firm technologicznych jednym z ważnych kierunków rozwoju AI. Jeżeli komputer potrafi dokładnie rozumieć naturalną mowę bez konieczności wypowiadania idealnie skonstruowanych komend, rozmowa może stać się jednym z podstawowych sposobów sterowania aplikacjami i agentami AI.
Google chce wprowadzić Gemini 3.5 Transcribe do wielu swoich produktów
Nowa technologia nie pozostanie wyłącznie eksperymentem dostępnym przez API. Gemini 3.5 Transcribe jest już wykorzystywany przez Google w wybranych usługach. Jednym z przykładów jest funkcja Rambler dostępna w Gboard na Androidzie, która pozwala użytkownikowi swobodnie dyktować tekst, a następnie automatycznie usuwa słowa-wypełniacze i porządkuje wypowiedź.
Model trafia również do aplikacji Gemini na macOS. Tutaj Google idzie jeszcze dalej – transkrypcja może zostać połączona z kontekstem widocznym na ekranie i innymi modelami Gemini. Użytkownik może dzięki temu nie tylko dyktować tekst, ale również głosowo zlecać analizę plików, wyszukiwanie informacji czy wykonywanie innych operacji.
Gemini 3.5 Transcribe jest także dostępny dla deweloperów w publicznej wersji preview poprzez Gemini API i Google AI Studio. Google zapowiada ponadto integrację technologii z Chrome. Docelowo użytkownik ma mieć możliwość dyktowania tekstu bezpośrednio w polach znajdujących się na stronach internetowych – od wiadomości i formularzy po posty czy polecenia kierowane do AI.
W praktyce oznacza to, że Google buduje technologię, która może pojawić się jednocześnie w Androidzie, przeglądarce, aplikacji Gemini oraz zewnętrznych usługach korzystających z API.
Gemini 3.5 Transcribe pokazuje, w którą stronę zmierzają asystenci AI
Przez lata rozpoznawanie mowy było przede wszystkim dodatkiem umożliwiającym dyktowanie krótkich wiadomości albo wydawanie prostych poleceń. Rozwój generatywnej AI stopniowo zmienia jednak rolę głosu. System nie musi już jedynie rozpoznawać poszczególnych słów – może interpretować kontekst wypowiedzi, poprawiać jej strukturę i łączyć polecenie głosowe z kolejnymi operacjami wykonywanymi przez model.
Gemini 3.5 Transcribe jest dobrym przykładem tej zmiany. Technologia może stać się podstawą automatycznych napisów, notatek ze spotkań, transkrypcji rozmów telefonicznych czy agentów głosowych obsługujących klientów. Szczególnie ważna będzie przy tym możliwość pracy w rzeczywistych warunkach, gdzie pojawiają się hałas, różne akcenty, niewyraźna mowa i kilka osób uczestniczących w jednej rozmowie.
Google zaznacza jednak, że modele Gemini 3.5 Transcribe i Transcribe Live nadal mogą wykazywać typowe ograniczenia modeli generatywnych, w tym sporadyczne halucynacje, opóźnienia lub błędy. Nie oznacza to więc końca problemów z automatyczną transkrypcją. Kierunek jest jednak wyraźny: AI ma coraz mniej wymagać od człowieka dostosowania sposobu mówienia do maszyny, a coraz lepiej dostosowywać się do naturalnego sposobu komunikacji.
Podsumowanie
Gemini 3.5 Transcribe to jeden z najbardziej praktycznych elementów rozwijanej przez Google rodziny Gemini. Zamiast kolejnego modelu skoncentrowanego przede wszystkim na generowaniu tekstu, firma proponuje system rozwiązujący bardzo konkretny problem – dokładne zamienianie naturalnej mowy na uporządkowany tekst.
Obsługa hałasu w tle, wielu języków, różnych akcentów, specjalistycznego słownictwa oraz automatyczne usuwanie powtórzeń i przejęzyczeń mogą znacząco poprawić wygodę korzystania z dyktowania i agentów głosowych. Jeżeli deklarowane przez Google parametry potwierdzą się również poza kontrolowanymi testami, głos może stać się znacznie ważniejszym sposobem komunikowania się z aplikacjami opartymi na sztucznej inteligencji.
Źródło: Google – oficjalna prezentacja Gemini 3.5 Transcribe z 26 sierpnia 2026 roku.
Dziękujemy za przeczytanie artykułu na Techoteka.pl.
Publikujemy codziennie informacje o sztucznej inteligencji, nowych technologiach, IT oraz rozwoju agentów AI.
Obserwuj nas na Facebooku, aby nie przegapić kolejnych artykułów.



