Zaznacz stronę
Semantyczny kamuflaż: nowa metoda ataku na modele językowe

Semantyczny kamuflaż: nowa metoda ataku na modele językowe

Badacze odkryli, że zabezpieczenia LLM są powierzchowne – ataki owijające szkodliwe intencje w neutralny kontekst (np. pisanie kreatywne) skutecznie omijają systemy ochrony. Analiza trzech rodzin modeli ujawniła uniwersalny punkt krytyczny, w którym model...
OpenAI wprowadza nowe zabezpieczenia po naruszeniu Hugging Face

OpenAI wprowadza nowe zabezpieczenia po naruszeniu Hugging Face

OpenAI wdrożyło nowe środki bezpieczeństwa obejmujące szczegółowy monitoring modeli w trakcie procesu rozwoju oraz większy nacisk na alignment i bezpieczeństwo podczas post-treningu. Kroki podjęto w następstwie naruszenia bezpieczeństwa na platformie Hugging...