utworzone przez Redakcja | wrz 14, 2026
Naukowcy sprawdzili, czy natywne połączenie modelu językowego z harnesem producenta faktycznie rozwiązuje więcej zadań kodowania. Na prywatnym zestawie 256 zadań nie stwierdzono istotnej przewagi żadnego z testowanych środowisk.
utworzone przez Redakcja | wrz 10, 2026
Naukowcy stworzyli publiczny zbiór 558 pełnych trajektorii agentów AI, który rejestruje proces rozumowania modeli podczas wykonywania 124 zadań naukowych. W przeciwieństwie do istniejących benchmarków, OpenDiscoveryTrace analizuje nie tylko końcowe wyniki, ale całą...
utworzone przez Redakcja | wrz 7, 2026
Badacze przedstawili Harbor Adapters – zunifikowaną infrastrukturę do ewaluacji agentów AI, obejmującą ponad 80 benchmarków. Przeprowadzono też szeroko zakrojone testy 8 modeli na 54 benchmarkach, ujawniając nowe wzorce możliwości i błędów...
utworzone przez Redakcja | wrz 6, 2026
OpenAI zaktualizowało kilka benchmarków ewaluacyjnych dla modelu GPT-6 Astra po opublikowaniu ogłoszenia, wprowadzając zmiany, które wydają się faworyzować ten model. Firma kontynuuje rewizję metryk już po premierze.
utworzone przez Redakcja | wrz 2, 2026
Google uruchomiło model Gemini 3.8 Flash Cyber dedykowany partnerom w ramach nowego programu Fairwind, twierdząc że Gemini 3.8 Flash wyprzedza Opus 5 i GPT-5.6 Sol na wybranych benchmarkach. Nowe modele Gemini skupiają się na agentycznych przepływach pracy i...