中文

构建高效且鲁棒的策略选择测试

机器学习 2023-06-14 v1 人工智能 计算机科学与博弈论

摘要

现代强化学习系统在学习过程中产生许多高质量策略。然而,要从中选择实际部署于真实世界的策略,必须在难以穷尽的环境条件下对其进行测试。我们提出RPOSST,一种基于相对较少的样本评估从大规模测试池中选取出少量测试用例的算法。RPOSST将测试用例选择问题视为双人博弈,并优化出具有可证明k-of-N鲁棒性的解,将误差相对于使用测试池中所有测试用例的测试进行界定。实证结果表明,RPOSST在玩具一次性博弈、扑克数据集以及高保真赛车模拟器中均能找到可识别高质量策略的少量测试用例。

关键词

引用

@article{arxiv.2306.07372,
  title  = {Composing Efficient, Robust Tests for Policy Selection},
  author = {Dustin Morrill and Thomas J. Walsh and Daniel Hernandez and Peter R. Wurman and Peter Stone},
  journal= {arXiv preprint arXiv:2306.07372},
  year   = {2023}
}

备注

26 pages, 13 figures. To appear in Proceedings of the Thirty-Ninth Conference on Uncertainty in Artificial Intelligence (UAI 2023)