UCRL-V algorithm achieves optimal regret in unknown MDPs.
problem Optimizing reinforcement learning in unknown finite Markov decision processes.
method Empirical Bernstein inequalities for variance-based confidence intervals.
result Achieves optimal regret up to logarithmic factors.