utworzone przez Redakcja | sie 31, 2026
Badacze uruchomili otwarty model językowy Qwen2.5-14B (9 GB, 4-bit) na pełnym zbiorze 529 939 pytań z 41 sezonów teleturnieju Jeopardy! (1984–2025), pokazując, że wiedza porównywalna do systemu IBM Watson jest dziś przenośna i praktycznie darmowa.
utworzone przez Redakcja | sie 3, 2026
Naukowcy opracowali protokół benchmarkowy do oceny prac naukowych generowanych przez AI, testując cztery wiodące frameworki AI-Scientist przy użyciu automatycznego systemu recenzji opartego na dużych modelach językowych.
utworzone przez Redakcja | lip 24, 2026
Naukowcy przeprowadzili pierwsze kompleksowe badanie wpływu technik znakowania wodnego (watermarking) na jakość działania dużych modeli językowych w medycynie. Przetestowano 5 schematów znakowania na 11 modelach LLM i 7 modelach VLM w zadaniach klinicznych, ujawniając...
utworzone przez Redakcja | lip 14, 2026
Badacze odkryli, że różne formaty promptów mogą drastycznie zmieniać wyniki modeli językowych, wprowadzając dwa nowe metryki FSI i PSI do pomiaru tej wrażliwości. Analiza 140 000 generacji pokazała ponad 30-krotne różnice między modelami.
utworzone przez Redakcja | maj 28, 2026
Naukowcy przedstawili DynaSchedBench – framework diagnostyczny dla dynamicznego harmonogramowania zadań, który eliminuje problemy z przeregulowaniem benchmarków i szumem stochastycznym. Kluczowym elementem jest kalibrowany generator instancji SESC z indeksem trudności...