Hence our modified policy iteration is, repeated until convergence: Approximate policy evaluation: repeat fixed number of times Ui+1(s)←R(s)+γ∑s′P(s′∣s,πi(s))Ui(s′) Policy improvement: for every state s: πi+1(s)=arg a∈A(s)max∑s′P(s′∣s,a)Ui(s′)