teaching
Value Iteration in Grid World Value Iteration in Grid World Grid Größe: Gamma: Theta: Initialisieren Positionen der Hindernisse (x,y Paare): Zielposition (x,y): Bellman-Gleichung für Value Iteration: V(s) = maxa Σs’ [P(s’|s,a) * (R(s,a,s’) + γ * V(s’))] Wo: V(s) der Wert des Zustands s ist P(s’|s,a) die Übergangswahrscheinlichkeit ist (hier angenommen als deterministisch, daher = … Read More “Gridworld RL” »
