ChatGPT-4o vs Google Gemini Live — jak radzą sobie nowi asystenci AI

Przez
Jugo Mobile
Jugo Mobile to platforma poświęcona wysokiej jakości treściom z zakresu gier, sportu i technologii. Odkrywaj najwyższej klasy materiały, nawiązuj kontakt z innymi pasjonatami i ekspertami. Poznaj...
4 min czytania

We wtorek podczas wydarzenia Google I/O firma Google zaprezentowała nowy produkt oparty na sztucznej inteligencji — Gemini Live. Wszyscy zakładaliśmy, że właśnie to powinien robić Asystent Gemini w Androidzie, ale to jest Google i wszystko jest dozwolone.

Gdyby nie fakt, że wydarzenie to ma miejsce zaledwie dzień po pierwszym wydarzeniu poświęconym produktom konsumenckim OpenAI, zastanawiałbym się, czy wypuszczono Gemini Live, aby obsługiwać ChatGPT Voice. Obydwa są zbudowane przy użyciu natywnych, multimodalnych modeli sztucznej inteligencji i oferują imponujące możliwości przesyłania głosu i wideo.

Obecnie w globalnym wyścigu sztucznej inteligencji przodują OpenAI i Google, przy czym ten pierwszy pozornie dogaduje się z Apple i iPhonem, a drugi ma kontrolę nad Androidem. Zapomnij o urządzeniach AI, takich jak Rabbit r1 czy Humane Pin — krótkoterminowym zwycięzcą jest smartfon.

Zarówno ChatGPT Voice, jak i Gemini Live są integrowane z istniejącym produktem AI i żaden z nich nie jest obecnie dostępny — ale jak inaczej można porównać tych asystentów nowej generacji?

Jak wypadają porównania Gemini Live i ChatGPT 4o?

Google pozostaje trochę w tyle, jeśli chodzi o wiarygodność, szczególnie jeśli chodzi o pokazywanie analizy wideo na żywo i możliwości głosowych. Kiedy w zeszłym roku ogłosiła Gemini Ultra, udostępniła wideo, na którym reaguje na wideo w czasie rzeczywistym – tyle że nie było to wideo ani wideo w czasie rzeczywistym.

Tym razem jednak postawili sobie za cel udostępnienie technologii, a przynajmniej jej podstawowego aspektu „Projektu Astra”, w tym rozmów głosowych i wideo, do wypróbowania na wejściu/wyjściu.

Obydwa oferują konwersacyjny interfejs głosowy w języku naturalnym, oba oferują potencjał analizy wideo na żywo za pomocą aparatu w smartfonie i oba wydają się wystarczająco szybkie, aby zapewnić prawdziwie naturalną rozmowę, w której można przerwać działanie sztucznej inteligencji w połowie.

Istnieją jednak pewne zauważalne różnice. Głos ChatGPT OpenAI brzmi bardziej naturalnie, potrafi wykrywać emocje i tony głosu i reagować na nie, a nawet dostosowywać się w czasie rzeczywistym do sposobu, w jaki go poprosisz o mówienie. Nie widziałem dowodów na tę zdolność w Gemini Live.

Inna duża różnica dotyczy multimodalności. Gemini nadal korzysta z innych modeli, w tym z Imagen 3 dla obrazów i Veo dla wideo. GPT-4o jest natywnie multimodalny w obu kierunkach — o oznacza omni lub we wszystkich kierunkach. Tworzy własne obrazy i dźwięki.

Gemini Live vs GPT-4o: Przyszłość asystentów głosowych

Google Glass Enterprise Edition 2

(Źródło zdjęcia: Google)

Wydaje się, że świat zmierza w stronę głosu i odchodzi od wprowadzania tekstu. Kiedy po raz pierwszy zobaczyłem ogłoszenie OpenAI, moją reakcją było to, że jest to zmiana paradygmatu w interfejsie człowiek-komputer, tak duża jak wypuszczenie myszy czy ekranu dotykowego.

Nadal podtrzymuję ten pogląd, a fakt, że Google udostępnia także natywny, naturalnie brzmiący interfejs głosowy, jeszcze bardziej to potwierdza. Nawet Meta ma swojego MetaAI, bota głosowego dostępnego w goglach VR i inteligentnych okularach Ray-Ban.

Choć na razie smartfon może zwyciężyć, jasne jest, że prawdziwym kształtem tych modeli głosowej sztucznej inteligencji są inteligentne okulary. Dostępne z kamerami umieszczonymi na wysokości oczu i ramionami, które wysyłają fale dźwiękowe do uszu – są idealnym urządzeniem AI.

Pytanie brzmi, czy OpenAI przejdzie na sprzęt, wypuszczając własną parę inteligentnych okularów, czy też będzie to nowa Siri, która będzie zasilać przyszły produkt Apple Glasses. Oraz czy Google rzeczywiście jest na tyle odważny, aby wskrzesić Google Glass.

  • ChatGPT z GPT-4o — nie pamiętam, kiedy ostatni raz byłem tak zachwycony technologią
  • Google właśnie odpowiedział na GPT-4o, udostępniając demo Gemini, które jest konwersacyjne i wykorzystuje wideo
  • OpenAI GPT-4o jest już wdrażany — oto jak uzyskać dostęp
Udostępnij ten artykuł
Obserwuj
Jugo Mobile to platforma poświęcona wysokiej jakości treściom z zakresu gier, sportu i technologii. Odkrywaj najwyższej klasy materiały, nawiązuj kontakt z innymi pasjonatami i ekspertami. Poznaj najnowsze trendy i innowacje w naszej dynamicznej społeczności. Dołącz do nas i doświadcz przyszłości już dziś!
Rozwijaj swoją markę i dotrzyj do szerszej publiczności. Reklamuj się u nas już dziś i zyskaj uwagę tysięcy.
© 2025 Jugo Mobile. Wszelkie prawa zastrzeżone.