utworzone przez Redakcja | wrz 14, 2026
Naukowcy opracowali metodę oceny marginalnej wartości modeli językowych w hybrydowym prognozowaniu zdarzeń. System automatycznie decyduje, kiedy model językowy wnosi realną wartość ponad dostępne prognozy rynkowe czy statystyczne.
utworzone przez Redakcja | wrz 9, 2026
Naukowcy zaproponowali CriticGen – framework oceny dużych modeli językowych, który zamienia ewaluację w praktyczne wskazówki do poprawy odpowiedzi. System generuje szczegółowe kryteria oceny i automatycznie udoskonala odpowiedzi modeli.
utworzone przez Redakcja | wrz 5, 2026
Naukowcy opracowali benchmark DSB-IFEval do oceny zdolności agentów głosowych do rozumienia niejawnych instrukcji w czasie rzeczywistym. Zestaw 1038 przypadków testowych sprawdza, jak agenci inferują właściwe zachowanie konwersacyjne z przypisanych im ról i...
utworzone przez Redakcja | wrz 4, 2026
Badacze opracowali system podręcznika do angielskiego oparty na AI z pięciowarstwową architekturą, który zwiększył dokładność ukończenia jednostek lekcyjnych z 72,4% do 84,9% i podniósł wyniki zadań mówienia o 10,8 punktu w porównaniu ze statycznym podręcznikiem...
utworzone przez Redakcja | wrz 3, 2026
Badacze opracowali formalną metodę oceny wiarygodności logiki wyekstrahowanej przez algorytmy z tekstów prawnych. Na zbiorze ponad 29 tys. sekcji ustaw Missouri wykazali, że dwa niezależne ekstraktory różnią się w 43% przypadków przy wykrywaniu progów...