A new algorithm for reinforcement learning using SVRPG.
problem Solving Markov Decision Processes (MDPs) with policy gradient methods.
method Stochastic variance-reduced policy gradient (SVRPG) algorithm.
result SVRPG achieves linear convergence under increasing batch sizes.