utworzone przez Redakcja | wrz 9, 2026
Naukowcy przedstawili MERIT – nowy benchmark mierzący realną użyteczność pamięci długoterminowej w agentach LLM wykonujących zadania z narzędziami, uwzględniający koszty operacji pamięci. Przetestowano go na 23 440 epizodach za łączny koszt 42,57...
utworzone przez Redakcja | wrz 6, 2026
Model GPT-6 o nazwie Astra jako pierwszy w historii pokonał benchmark Portal, ustanawiając nowy rekord wśród modeli językowych. To znaczące osiągnięcie w dziedzinie sztucznej inteligencji.
utworzone przez Redakcja | wrz 5, 2026
Naukowcy stworzyli benchmark CONFLICTGUI badający zdolność agentów GUI do rozpoznawania niemożliwych do wykonania instrukcji. Okazuje się, że agenty mają tendencję do ślepego wykonywania nawet sprzecznych poleceń, a framework CONFLICTGUARD ma temu...
utworzone przez Redakcja | wrz 5, 2026
Naukowcy opracowali benchmark DSB-IFEval do oceny zdolności agentów głosowych do rozumienia niejawnych instrukcji w czasie rzeczywistym. Zestaw 1038 przypadków testowych sprawdza, jak agenci inferują właściwe zachowanie konwersacyjne z przypisanych im ról i...
utworzone przez Redakcja | wrz 3, 2026
Naukowcy stworzyli EvalDetectBench – narzędzie mierzące, czy duże modele językowe potrafią rozpoznać, że są testowane. Jeśli modele zachowują się inaczej podczas ewaluacji niż w rzeczywistym użyciu, wyniki testów bezpieczeństwa AI tracą...