Zaznacz stronę
GPT-5.5 wykrył błędy krytyczne w benchmarku FrontierMath

GPT-5.5 wykrył błędy krytyczne w benchmarku FrontierMath

Model GPT-5.5 został wykorzystany do weryfikacji testu FrontierMath i odkrył poważne błędy w około trzeciej części zadań. Incydent pokazuje, że modele AI stały się już na tyle zaawansowane, że mogą sprawdzać poprawność własnych...
GPT 5.5 bije rekordy w rozpoznawaniu tytułów artykułów naukowych

GPT 5.5 bije rekordy w rozpoznawaniu tytułów artykułów naukowych

Model GPT 5.5 wykazał najlepsze wyniki w prywatnym benchmarku Kaggle polegającym na odgadnięciu dokładnego tytułu artykułu naukowego na podstawie jego streszczenia. Test stanowi efektywny wskaźnik zdolności modelu do prawidłowego przypisywania twierdzeń naukowych ich...