utworzone przez Redakcja | maj 2, 2026
Opublikowano wyniki testów modeli sztucznej inteligencji GPT-5.5 i Opus 4.7 na benchmarku ARC-AGI-3, uzyskując odpowiednio 0,43% i 0,18% skuteczności. Benchmark ARC-AGI-3 pozostaje znaczącym wyzwaniem dla współczesnych modeli AI.
utworzone przez Redakcja | kwi 27, 2026
Naukowcy z arXiv zaproponowali nowy benchmark oceniający zdolność modeli językowych do konstruowania pojęć matematycznych przez komunikację. Test bada, czy sztuczna inteligencja posiada autentyczne rozumowanie matematyczne, czy tylko dopasowuje wzorce...
utworzone przez Redakcja | kwi 25, 2026
Naukowcy przedstawili MMTR-Bench, nowy benchmark do testowania umiejętności multimodalnych modeli językowych w rekonstruowaniu maskowanego tekstu bezpośrednio z kontekstu wizualnego, bez jawnych instrukcji.
utworzone przez Redakcja | kwi 24, 2026
Naukowcy proponują nowe podejście do ewaluacji modeli AI, traktując je jako pluralistyczne systemy społeczno-techniczne. Zamiast tradycyjnych benchmarków, framework MaSH Loops uwzględnia wpływ interakcji między modelami, użytkownikami i instytucjami.
utworzone przez Redakcja | kwi 22, 2026
Naukowcy zaproponowali nową metodę oceny modeli języka (LLM) uwzględniającą indywidualne preferencje użytkowników zamiast uśrednionych ocen. Badania pokazują, że ranking modeli AI powinien być dostosowany do konkretnych potrzeb i kontekstu każdego...