Claude 3 Opus, model sztucznej inteligencji nowej generacji firmy Anthropic, zajął pierwsze miejsce w tabeli liderów Chatbot Arena, spychając GPT-4 OpenAI na drugie miejsce po raz pierwszy od jego premiery w zeszłym roku.
W odróżnieniu od innych form benchmarkingu modeli AI, the Arena chatbotów LMSYS opiera się na ludzkich głosach, a ludzie na ślepo przypisują wyniki dwóch różnych modeli do tego samego podpowiedzi.
Różne wersje GPT-4 OpenAI utrzymują czołowe miejsca od tak dawna, że każdy inny model zbliżający się do ich wyników w benchmarkach jest nazywany modelem klasy GPT-4. Być może będziemy musieli wprowadzić nowy model klasy Claude-3 na potrzeby przyszłych rankingów.
Warto zauważyć, że wynik pomiędzy Claude 3 Opus i GPT-4 jest bardzo zbliżony, a model OpenAI jest dostępny od roku, a „wyraźnie inny” GPT-5 spodziewany jest w pewnym momencie tego roku — więc Anthropic może nie utrzymać pozycję długo.
Jaka jest arena chatbotów?
Chatbot Arena prowadzona jest przez LMSys, organizację Large Model Systems Organisation i zawiera szeroką gamę dużych modeli językowych walczących w anonimowych, losowych bitwach.
Uruchomiony po raz pierwszy w maju ubiegłego roku, zebrał ponad 400 000 głosów użytkowników, a modele z Anthropic, OpenAI i Google zajęły w tym czasie większość pierwszej dziesiątki.
Ostatnio inne modele francuskiego startupu AI Mistral i chińskich firm, takich jak Alibaba, zaczęły zajmować więcej czołowych miejsc, a modele open source są coraz bardziej obecne.
Wykorzystuje system oceny Elo, który jest szeroko stosowany w grach takich jak szachy, aby obliczyć względny poziom umiejętności graczy. Inaczej niż w szachach, tym razem ranking odnosi się do chatbota, a nie do człowieka korzystającego z modelu.
Arena ma ograniczenia, ponieważ nie wszystkie modele lub wersje modeli są uwzględnione. Czasami użytkownicy stwierdzają, że modele GPT-4 nie ładują się, co może faworyzować modele z dostępem do Internetu na żywo, takie jak Google Gemini Pro.
Na arenie brakuje także kilku znanych modeli, takich jak Google Gemini Pro 1.5 z ogromnym oknem kontekstowym i Gemini Ultra.
Claude 3 Haiku może być na poziomie GPT-4
Ponad 70 000 nowych głosów złożyło się na najnowszą aktualizację, dzięki której Claude 3 Opus zajął pierwsze miejsce w tabeli liderów, ale nawet najmniejszy z modeli Claude 3 spisał się dobrze.
LMSYS wyjaśnił: „Claude-3 Haiku zaimponował wszystkim, a nawet osiągnął poziom GPT-4 według naszych preferencji użytkownika! Jego szybkość, możliwości i długość kontekstu nie mają sobie równych obecnie na rynku.”
Jeszcze bardziej imponujące jest to, że Claude 3 Haiku to model „rozmiaru lokalnego”, porównywalny z Gemini Nano firmy Google. Osiąga imponujące wyniki bez ogromnej skali parametrów Opusa czy któregokolwiek z modeli klasy GPT-4.
Choć nie tak inteligentne jak Opus czy Sonnet, Haiku firmy Anthropic jest znacznie tańsze, znacznie szybsze i, jak sugerują wyniki na arenie, równie dobre, jak znacznie większe modele w ślepych testach.
Wszystkie trzy modele Claude 3 znajdują się w pierwszej dziesiątce, a Opus na pierwszym miejscu, Sonnet na czwartym miejscu wraz z Gemini Pro, a Haiku na szóstym miejscu z wcześniejszą wersją GPT-4.
Zwycięstwo dla zamkniętych modeli AI
Wszystkie z 20 największych modeli językowych znajdujących się w rankingach na arenie trzech z wyjątkiem trzech są zastrzeżone, co sugeruje, że oprogramowanie open source ma jeszcze sporo do zrobienia, aby dotrzeć do największych graczy.
Oczekuje się, że Meta, która mocno koncentruje się na sztucznej inteligencji typu open source, w ciągu najbliższych kilku miesięcy wypuści Llamę 3, która prawdopodobnie wejdzie do pierwszej dziesiątki, ponieważ oczekuje się, że będzie podobna pod względem możliwości do Claude 3 — w końcu Meta ma 300 000 + Nvidia Procesory graficzne H100 do trenowania.
Widzimy także inne posunięcia w obszarze open source i zdecentralizowanej sztucznej inteligencji, w tym założyciel StabilityAI, Emad Mostaque, wycofujący się z obowiązków dyrektora generalnego i skupiający się na bardziej rozproszonej i dostępnej sztucznej inteligencji. Powiedział, że nie da się pokonać scentralizowanej sztucznej inteligencji bardziej scentralizowaną sztuczną inteligencją.
- Nowa sztuczna inteligencja VLOGGER firmy Google umożliwia utworzenie realistycznego awatara ze zdjęcia
- Apple może przenieść Google Gemini na iPhone’a do zadań AI
- Dałem Claude’owi, ChatGPT i Gemini zdjęcie składników, aby zobaczyć, który z nich wyszedł najlepszy przepis