Pytania oznaczone «q-learning»

21

Jaki jest związek między Q-learningiem a metodami gradientów polityki?

O ile rozumiem, Q-learning i gradienty polityki (PG) to dwa główne podejścia stosowane do rozwiązywania problemów RL. Podczas gdy Q-learning ma na celu przewidzenie nagrody za pewne działanie podjęte w określonym stanie, gradienty polityki bezpośrednio przewidują samo działanie. Jednak oba...

12

Dlaczego DQN wymaga dwóch różnych sieci?

Przechodziłem przez tę implementację DQN i widzę, że na linii 124 i 125 zainicjowano dwie różne sieci Q. Z mojego zrozumienia, myślę, że jedna sieć przewiduje odpowiednie działanie, a druga sieć przewiduje docelowe wartości Q dla znalezienia błędu Bellmana. Dlaczego nie możemy stworzyć jednej...

reinforcement-learning q-learning dqn

12

Dlaczego Q-learning nie jest zbieżny podczas korzystania z aproksymacji funkcji?

Tabelaryczny algorytm uczenia Q gwarantuje znalezienie optymalnego QQQ funkcjonować, Q∗Q∗Q^*, pod warunkiem spełnienia następujących warunków (warunki Robbins-Monro ) dotyczących wskaźnika uczenia się ∑tαt(s,a)=∞∑tαt(s,a)=∞\sum_{t} \alpha_t(s, a) = \infty ∑tα2t(s,a)<∞∑tαt2(s,a)<∞\sum_{t}...

reinforcement-learning q-learning deep-rl proofs function-approximation