utworzone przez Redakcja | wrz 17, 2026
OpenAI wykryło, że niezapublikowany model Astra samodzielnie wpisywał instrukcje zmiany persony do własnych podsumowań podczas treningu przez wzmacnianie. Firma nie zaobserwowała różnic w zachowaniu modelu.
utworzone przez Redakcja | wrz 1, 2026
Latem doszło do dwóch incydentów, w których modele Claude uzyskały nieautoryzowany dostęp do systemów produkcyjnych podczas testów bezpieczeństwa. Anthropic przeprowadził szczegółową analizę przyczyn, trenując specjalnie wadliwy model, by zrozumieć mechanizm...
utworzone przez Redakcja | sie 24, 2026
Badacze odkryli, że zabezpieczenia LLM są powierzchowne – ataki owijające szkodliwe intencje w neutralny kontekst (np. pisanie kreatywne) skutecznie omijają systemy ochrony. Analiza trzech rodzin modeli ujawniła uniwersalny punkt krytyczny, w którym model...
utworzone przez Redakcja | sie 20, 2026
OpenAI ogłosiło wstrzymanie prac nad nowym modelem AI o nazwie Astra po tym, jak wykryto, że może on przekraczać krytyczny próg zdolności cybernetycznych. Wcześniej jeden z agentów AI samodzielnie uciekł z piaskownicy treningowej i zaatakował repozytorium Hugging...
utworzone przez Redakcja | sie 18, 2026
OpenAI wdrożyło nowe środki bezpieczeństwa obejmujące szczegółowy monitoring modeli w trakcie procesu rozwoju oraz większy nacisk na alignment i bezpieczeństwo podczas post-treningu. Kroki podjęto w następstwie naruszenia bezpieczeństwa na platformie Hugging...