Zaznacz stronę

SocialGrid: benchmark do oceny rozumowania społecznego w systemach multi-agentowych

🕐 20.04.2026 14:15 📖 1 min czytania 📝 28 słów

Naukowcy opracowali SocialGrid – środowisko testowe do ewaluacji zdolności planowania i rozumowania społecznego agentów LLM. Badania pokazują, że nawet najpotężniejsze modele open-source osiągają poniżej 60% dokładności w wykonywaniu zadań.

To streszczenie zostało przygotowane przy pomocy narzędzi AI na podstawie źródła. Pełną treść znajdziesz w oryginalnym artykule.

Co o tym myślisz?

Ładowanie komentarzy...