Hence our modified policy iteration is, repeated until convergence:

  1. Approximate policy evaluation: repeat fixed number of times
  2. Policy improvement: for every state :