Przejdź do treści
Algorytmy

ChatGPT Voice uczy się słuchać, gdy mówi. OpenAI stawia na full-duplex i tłumaczenie na żywo

OpenAI zaprezentowało dwa modele głosowe, które potrafią jednocześnie mówić i słuchać. Dzięki architekturze full-duplex ChatGPT Voice po raz pierwszy reaguje na przerwania, wahania i ciszę — jak człowiek.

3 min read
ChatGPT Voice uczy się słuchać, gdy mówi. OpenAI stawia na full-duplex i tłumaczenie na żywo

ChatGPT dostał uszy i język nowej generacji. 8 lipca 2026 roku OpenAI zaprezentowało dwa modele głosowe — GPT-Live-1 i GPT-Live-1 mini — które nie tylko generują mowę, ale naprawdę uczestniczą w rozmowie. Co to oznacza w praktyce? Koniec z udawanym słuchaniem i mechanicznymi pauzami. Maszyna po raz pierwszy potrafi zarazem mówić i słuchać.

Full-duplex, czyli koniec monologu

Czytaj też: GPT-5.6 Sol usunął pliki programiście. Czy agentom AI można ufać?

Dotychczasowe interfejsy głosowe działały w trybie półdupleksowym — gdy mówiło jedno, drugie czekało. Człowiek milkł, a system dopiero wtedy przetwarzał nagranie i generował odpowiedź. To działało, ale przypominało rozmowę przez krótkofalówkę, nie dialog.

Nowa architektura full-duplex znosi tę barierę. Model odbiera dźwięk i równolegle go emituje. Dzięki temu reaguje na przerwania, westchnięcia i zawahania. Można zamilknąć w pół słowa, pomyśleć przez dwie sekundy i podjąć wątek — ChatGPT Voice nie wejdzie nam w zdanie. Niemiecki Heise nazwał to architekturą, która „słucha, podczas gdy mówi”. To celne podsumowanie, bo o tę właśnie równoczesność chodzi.

Oddech, rytm i dziewięć głosów od nowa

Czytaj też: Agent OpenAI uciekł i zaatakował Hugging Face. Firma przyznaje: to mógł być GPT-6

OpenAI nie tylko przepisało silnik konwersacji. Firma „zremasterowała” wszystkie dziewięć istniejących głosów ChatGPT. Efekt? Mniej syntetycznej sztywności, więcej prozodii — naturalnego tempa, akcentów i pauz. Brzmienie ma być bliższe ludzkiemu oddechowi niż wygładzonej syntezie znanej z poprzednich wersji.

Co więcej, użytkownik zyskuje kontrolę nad „głębokością myślenia” modelu. Do wyboru są trzy poziomy refleksji:

  • Natychmiastowy — odpowiedź pada od razu, bez analitycznej zwłoki.
  • Średni — krótka chwila na przetworzenie kontekstu.
  • Wysoki — model poświęca więcej czasu na złożone rozumowanie, nie przerywając przy tym dialogu.

W tle system może oddelegować trudniejsze zadanie do modelu tekstowego, na przykład GPT-5.5, i płynnie wrócić z wynikiem. Rozmowa toczy się nieprzerwanie, choć pod maską pracuje kilka różnych silników.

Tłumaczenie w czasie rzeczywistym i karty kontekstowe

Jedna z demonstracji pokazała tłumaczenie na żywo z angielskiego na hindi. Reakcja była natychmiastowa, choć sama firma nie podała jeszcze szczegółowych metryk dokładności. Kierunek jest jednak wyraźny — interakcje wielojęzyczne bez przełączania aplikacji.

Do tego dochodzi warstwa wizualna. Podczas rozmowy głosowej ChatGPT może wyświetlać karty informacyjne — prognozę pogody, notowania giełdowe czy streszczenie artykułu. To nie tylko dźwięk, ale także kontekst wizualny, który pojawia się bez proszenia. Według Numeramy funkcje te łączą się z już istniejącymi możliwościami — pamięcią rozmów, analizą plików i wyszukiwaniem w sieci.

Bezpieczeństwo głosu, którego nie słychać

Nowe modele przeszły trening bezpieczeństwa skoncentrowany na kilku kategoriach ryzyka specyficznych dla interakcji głosowej. Dodano zabezpieczenia antyphishingowe i antymanipulacyjne, chroniące przed nadużyciami w czasie rzeczywistym. OpenAI nie ujawnia pełnej listy zagrożeń, ale podkreśla, że architektura GPT-Live-1 powstała z myślą o zadaniach „coraz bardziej agentowych” — czyli takich, gdzie model działa samodzielnie w imieniu użytkownika.

Modele trafią na wszystkie główne platformy — iOS, Androida i przeglądarkę — i będą dostępne w planach Free, Go, Plus oraz Pro. Wdrożenie rozpoczęło się 8 lipca 2026 roku i potrwa kilka tygodni.

To coś więcej niż aktualizacja asystenta głosowego. To próba zbudowania interfejsu, który nie tylko rozumie słowa, ale także intonację, wahanie i ciszę. A to właśnie w tych szczelinach często kryje się prawdziwa intencja rozmówcy.

Redakcja noktus.pl

Redakcja noktus.pl

AUTHOR
Redaguje