Adaptive exploration scheme for evaluating multiple policies with different rewards.
problem Online multi-reward multi-policy evaluation.
method Adapted -PAC perspective and MR-NaS exploration scheme to minimize sample complexity.
result Demonstrated effectiveness of adaptive exploration in tabular domains.