基于置信度自主性的交互式策略学习
人工智能
2014-01-16 v1
摘要
我们提出了基于置信度自主性(CBA),一种从示范中学习策略的交互式算法。CBA 算法由两个组件组成,利用了人类与计算机智能体互补的能力。第一个组件为置信执行,使智能体能够识别需要示范的状态,向人类教师请求示范,并基于获取的数据学习策略。该算法基于动作选择置信度的度量来选择示范,我们的结果表明,使用置信执行时,智能体学习策略所需的示范数量少于由人类教师选择示范时所需的数量。第二个算法组件为纠正示范,使教师能够通过额外的示范纠正智能体犯的任何错误,以改进策略和未来的任务表现。在一个复杂的模拟驾驶领域中对 CBA 及其各组件进行了比较和评估。完整的 CBA 算法产生了最佳的整体学习性能,在平衡学习过程中示范数量与错误动作数量之间的权衡的同时,成功复现了教师的行为。
引用
@article{arxiv.1401.3439,
title = {Interactive Policy Learning through Confidence-Based Autonomy},
author = {Sonia Chernova and Manuela Veloso},
journal= {arXiv preprint arXiv:1401.3439},
year = {2014}
}