Trajectory-wise CVs reduce variance in policy gradient methods.
problem High variance in estimating policy gradient estimates.
method Proposes trajectory-wise control variates to reduce variance without bias.
result Trajectory-wise CVs are optimal for variance reduction under reasonable assumptions.