Zaznacz stronę
Stabilne uczenie TD z regularyzacją dla polityk off-policy

Stabilne uczenie TD z regularyzacją dla polityk off-policy

Naukowcy wprowadzili metodę RETD (Regularized Emphatic TD), która rozwiązuje problem niestabilności próbkowanej dynamiki w uczeniu ze wzmocnieniem off-policy, zachowując właściwości oryginalnego algorytmu ETD przy stałym kroku uczenia.