W ubiegły wtorek Google ogłosił nowy produkt oparty na sztucznej inteligencji w Gemini Live. Podobnie jak niedawno ogłoszony GPT-4o firmy OpenAI, Gemini Live to natywny, multimodalny model sztucznej inteligencji z imponującymi możliwościami przesyłania głosu i wideo.
Gemini Live to tylko część „Projektu Astra”, uniwersalnego agenta AI, który potencjalnie pojawi się w inteligentnych okularach. Na razie Gemini Live będzie pierwszą iteracją tego rozwiązania na smartfonach.
Testy rozmów głosowych i wideo mogliśmy zobaczyć podczas demonstracji na Google I/O 2024.
Jednak Gemini Live nie jest dzisiaj dostępny. Jakie więc funkcje będą dostępne i kiedy możemy spodziewać się Gemini Live na urządzeniach z Androidem? Czytaj dalej, aby się dowiedzieć.
Funkcje Gemini Live

Google właśnie udostępniło Gemini 1.5 płatnym użytkownikom Gemini Advanced. Zawiera rozszerzone okno kontekstowe, które pozwala Gemini na przykład analizować wiele dużych dokumentów lub podsumowywać do 100 e-maili.
Wersja 1.5 dodaje ulepszenia w zakresie rozumienia obrazów oraz tworzenia wizualizacji i wykresów. W przeciwieństwie do GPT-4o, Gemini do przesyłania obrazów i wideo korzysta z innych modeli, takich jak Imagen 3 i Google Veo.
Aktualizacja 1.5 umożliwia przesyłanie Dokumentów Google, plików PDF i innych dokumentów do Gemini w celu uzyskania podsumowań, opinii i odpowiedzi.
Jeśli jesteś płatnym użytkownikiem Gemini Advanced, Gemini Live będzie częścią tej aktualizacji. Możesz wypróbować go przez dwa miesiące za darmo, ale potem Gemini Advanced kosztuje 19,99 USD miesięcznie.
Gemini Live będzie dostępne w aplikacji Gemini na Androida i iOS poprzez ikonę głosu w aplikacji. Obraz staje się pełnoekranowy i umożliwia użytkownikom dwukierunkową rozmowę z Gemini.
Podobnie jak w przypadku GPT-4o, użytkownicy mogą mówić w swoim tempie i przerywać Gemini, aby dodać nowe informacje lub wyjaśnić podpowiedzi. Większość demonstracji i filmów zaprezentowanych na konferencji Google I/O 2024 zawierała jeden głos żeński i jeden męski. Do wyboru ma być 10 różnych głosów.
Gemini Live otrzyma funkcję przypominającą Google Lens, która umożliwi użytkownikom korzystanie z aparatu w telefonie. Umożliwi to Gemini Live „zobaczenie” świata przez kamerę oraz przekazywanie opinii i odpowiedzi, co jest prekursorem potencjalnych inteligentnych okularów Project Astra, które Google umieścił w swoim filmie demonstracyjnym na żywo.
Kiedy będzie dostępny Gemini Live?

Nawet dla użytkowników Gemini Advanced usługa Gemini Live nie będzie dostępna od razu. A post na blogu z Google mówi o „nadchodzących miesiącach”. Znaleźliśmy tweet od Google podczas I/O, twierdząc, że „tego lata”.
Nie spodziewamy się, że ktokolwiek będzie miał Gemini Live w czerwcu. Wygląda na to, że Gemini Live zobaczymy najwcześniej pod koniec lipca.
Co więcej, możliwość korzystania z aparatu pojawi się dopiero „pod koniec tego roku”, co najprawdopodobniej oznacza aktualizację późną jesienią.
Niestety nie otrzymaliśmy informacji o tym, kiedy wszyscy będą mogli uzyskać dostęp do Gemini Live. Najlepsze, co widzieliśmy, to „najbliższa przyszłość”, która może przypadać w dowolnym momencie od 2024 r. do przyszłego roku.
- ChatGPT-4o vs Google Gemini Live — jak radzą sobie nowi asystenci AI
- Asystent AI Project Astra kradnie show w Google I/O — i współpracuje z inteligentnymi okularami
- Google I/O 2024 — 7 najlepszych demonstracji AI Gemini, które musisz zobaczyć