utworzone przez Redakcja | sie 15, 2026
Badacze odkryli, że język promptu wpływa na decyzje modeli LLM w scenariuszach wysokiego ryzyka. Japońskie zapytania drastycznie zmniejszały gotowość Claude'a do rekomendowania ataku nuklearnego – z 40% do 0% w niektórych scenariuszach.
utworzone przez Redakcja | sie 15, 2026
Badanie pokazuje, że modele językowe często zgadzają się z ludzkimi ocenami etycznymi, lecz opierają swoje wnioski na zupełnie innych przesłankach moralnych. Analiza uzasadnień ujawnia systematyczne rozbieżności między rozumowaniem człowieka a LLM, co podważa...
utworzone przez Redakcja | sie 15, 2026
Naukowcy ostrzegają, że metody alignmentu modeli AI – stworzone dla bezpieczeństwa – są technologiami podwójnego zastosowania, które mogą być wykorzystywane przez autorytarne reżimy do cenzury i manipulacji informacją. Ryzyko rośnie wraz z rosnącą rolą AI jako...
utworzone przez Redakcja | lip 11, 2026
Duże modele językowe stają się dostawcami wsparcia psychicznego, lecz ich bezpieczeństwo wymaga głębszej reformy. Naukowcy proponują trzypoziomowy system wyrównania wartości wzorowany na standardach klinicznych.
utworzone przez Redakcja | lip 7, 2026
Naukowcy badają, jak wewnętrzny pluralizm preferencji użytkowników podważa skuteczność lokalnych porównań parami stosowanych w projektowaniu systemów decyzyjnych i dopasowywaniu AI. Opracowali formalny model pluralistycznych preferencji, który ujawnia dwa rodzaje...