Zaznacz stronę
Nowa metoda uczenia TD przyspiesza predykcję off-policy w RL

Nowa metoda uczenia TD przyspiesza predykcję off-policy w RL

Naukowcy zaproponowali metodę STHTD-MP, która ulepsza gradient temporal-difference learning poprzez zastosowanie macierzy Bellmana polityki zachowania jako metryki geometrii aktualizacji. Podejście zapewnia szybszą zbieżność przy zachowaniu stabilności.
Lepsze LoRA dla postaci dzięki mapom głębi i szumowaniu wag

Lepsze LoRA dla postaci dzięki mapom głębi i szumowaniu wag

Nowa metoda trenowania character LoRA łączy mapy głębi z szumowaniem wag (weight noising), czyli gaussowskimi perturbacjami wstrzykiwanymi do wag modelu podczas treningu. Technika pomaga modelowi 'zapominać' błędy i zachowywać tylko spójne cechy z...