utworzone przez Redakcja | maj 25, 2026
Naukowcy przedstawili framework do mierzenia zużycia energii systemów AI na poziomie kompletnych zadań użytkownika, a nie pojedynczych wywołań modelu. Nowa metrika Energy per Successful Goal (EpG) lepiej reprezentuje rzeczywisty koszt energetyczny złożonych przepływów...
utworzone przez Redakcja | maj 20, 2026
Naukowcy wprowadzili DecisionBench, nową platformę testową do oceny umiejętności delegacji zadań przez systemy AI w długoterminowych przepływach pracy. Benchmark integruje 11 modeli, różne metryki jakości oraz interfejsy komunikacji między agentami.
utworzone przez Redakcja | maj 19, 2026
Naukowcy przedstawili agentyczny framework RTL-BenchMT, który automatycznie identyfikuje i naprawia błędy w benchmarkach generacji kodu RTL wspieranej przez duże modele językowe, znacznie zmniejszając nakład pracy ręcznej.
utworzone przez Redakcja | maj 13, 2026
Naukowcy opracowali nowe standardy i benchmarki do oceny zdolności modeli LLM do wykrywania halucynacji – fikcyjnych lub niespójnych treści generowanych przez sztuczną inteligencję. Wykazali, że istniejące benchmarki nie spełniają wszystkich kluczowych...
utworzone przez Redakcja | maj 12, 2026
Naukowcy opracowują nowe metody benchmarkingu dla modeli AI używanych w klinikach, skupiając się na niezawodności i bezpieczeństwie w rzeczywistych warunkach medycznych, a nie tylko na samej wydajności.