中文

超越价值:用于测试基于规划的强化学习中推理的 CHECKLIST

人工智能 2022-06-09 v2 机器学习

摘要

强化学习(RL)智能体通常通过其在测试场景分布上的期望价值来评估。遗憾的是,这种评估方法为部署后超出测试分布的泛化能力提供了有限的证据。在本文中,我们通过将自然语言处理中近期的 CheckList 测试方法扩展到基于规划的 RL 来解决这一局限。具体而言,我们考虑测试通过在线树搜索使用习得转移模型与价值函数做决策的 RL 智能体。核心思想是通过 CheckList 方法在树搜索期间探索和评估智能体的推理,从而改善对未来性能的评估。该方法为用户提供接口和通用查询规则机制,以识别潜在的推理缺陷并验证预期的推理不变性。我们展示了一项涉及知识型 AI 研究者的用户研究,他们使用该方法来评估一个训练用于游玩复杂实时策略游戏的智能体。结果表明该方法能有效让用户识别智能体推理中先前未知的缺陷。此外,我们的分析提供了关于 AI 专家如何使用此类测试方法的见解,这可能有助于改进未来的实例化。

关键词

引用

@article{arxiv.2206.02039,
  title  = {Beyond Value: CHECKLIST for Testing Inferences in Planning-Based RL},
  author = {Kin-Ho Lam and Delyar Tabatabai and Jed Irvine and Donald Bertucci and Anita Ruangrotsakun and Minsuk Kahng and Alan Fern},
  journal= {arXiv preprint arXiv:2206.02039},
  year   = {2022}
}

备注

This work will appear in the Proceedings of the 32nd International Conference on Automated Planning and Scheduling (ICAPS2022) https://icaps22.icaps-conference.org/papers