Naukowcy opracowali SocialGrid – środowisko testowe do ewaluacji zdolności planowania i rozumowania społecznego agentów LLM. Badania pokazują, że nawet najpotężniejsze modele open-source osiągają poniżej 60% dokładności w wykonywaniu zadań.
To streszczenie zostało przygotowane przy pomocy narzędzi AI na podstawie źródła. Pełną treść znajdziesz w oryginalnym artykule.



Co o tym myślisz?
Zaloguj się, aby dołączyć do dyskusji.
Zaloguj się do dzis.ai
Komentuj, zachowaj swoją passę, dołącz do dyskusji.
G Kontynuuj z Google