utworzone przez Redakcja | maj 12, 2026
Model GPT-5.5 został wykorzystany do weryfikacji testu FrontierMath i odkrył poważne błędy w około trzeciej części zadań. Incydent pokazuje, że modele AI stały się już na tyle zaawansowane, że mogą sprawdzać poprawność własnych...
utworzone przez Redakcja | maj 12, 2026
Artificial Analysis wprowadził indeks do oceny agentów kodujących, zawierający trzy benchmarki obejmujące realistyczne zadania programistyczne, zadania terminalowe i pytania techniczne dotyczące zachowania kodu.
utworzone przez Redakcja | maj 11, 2026
Nowy test PACT ocenia umiejętności negocjacyjne dużych modeli językowych w 20-rundowej grze kupca-sprzedawcy. W rankingu prowadzą GPT-5.5, Opus 4.7 i DeepSeek V4 Pro.
utworzone przez Redakcja | maj 2, 2026
Model GPT 5.5 wykazał najlepsze wyniki w prywatnym benchmarku Kaggle polegającym na odgadnięciu dokładnego tytułu artykułu naukowego na podstawie jego streszczenia. Test stanowi efektywny wskaźnik zdolności modelu do prawidłowego przypisywania twierdzeń naukowych ich...
utworzone przez Redakcja | maj 2, 2026
Nowy benchmark mierzy wydajność operacji atencji na GPU, kluczowego wąskiego gardła w modelach generatywnych. Test wykorzystuje rzeczywiste kształty tensorów z modeli obrazu, wideo i audio.