utworzone przez Redakcja | wrz 18, 2026
Naukowcy wprowadzili metodę RETD (Regularized Emphatic TD), która rozwiązuje problem niestabilności próbkowanej dynamiki w uczeniu ze wzmocnieniem off-policy, zachowując właściwości oryginalnego algorytmu ETD przy stałym kroku uczenia.