发现强化学习中的盲点
机器学习
2018-05-24 v1 人工智能
机器学习
摘要
在仿真中训练的智能体可能因训练环境与执行环境之间的不匹配而在真实世界中犯错。这些错误可能带来危险且难以发现,因为智能体无法先验地预测它们。我们提出利用 oracle 反馈来学习这些盲点的预测模型,以减少真实世界应用中的高昂错误代价。我们关注由于状态表示不完整而在强化学习(RL)中出现的盲点:智能体不具备合适的特征来表示世界的真实状态,因而无法区分众多状态。我们将 RL 中盲点发现问题形式化为一个存在类别不平衡的有噪监督学习问题。我们通过结合标签聚合、校准与监督学习的技术,学习在状态空间未观测区域预测盲点的模型。这些模型考虑了由不同形式 oracle 反馈(包括演示与纠正)产生的噪声。我们在两个领域上评估了我们的方法,表明其预测性能优于基线方法,且所学模型可用于在执行时选择性查询 oracle 以防止错误。我们还通过实证分析了各类反馈类型的偏差及其如何影响盲点的发现。
引用
@article{arxiv.1805.08966,
title = {Discovering Blind Spots in Reinforcement Learning},
author = {Ramya Ramakrishnan and Ece Kamar and Debadeepta Dey and Julie Shah and Eric Horvitz},
journal= {arXiv preprint arXiv:1805.08966},
year = {2018}
}
备注
To appear at AAMAS 2018