从演示中学习行为软约束
机器学习
2022-02-22 v1 人工智能
计算机与社会
摘要
许多现实场景要求人类做出艰难的权衡:我们是否总是遵守所有交通规则,还是在紧急情况下超速?这些场景迫使我们评估集体规则与规范同个人目标及欲望之间的权衡。为创建高效的人机团队,我们必须赋予 AI 智能体一种模型,用以刻画在存在隐式与显式规则及约束的复杂环境中人类如何做出此类权衡。配备这些模型的智能体将能够镜像人类行为,和/或将人类注意力吸引到可改进决策的情境中。为此,我们提出一种新颖的逆强化学习(IRL)方法:最大熵逆软约束 IRL(MESC-IRL),用于从确定性及非确定性环境(建模为马尔可夫决策过程(MDPs))的演示中学习关于状态、动作与状态特征的隐式硬约束与软约束。我们的方法使智能体无需设计者显式建模即可隐式学习人类约束与欲望,并在环境间迁移这些约束。我们的新颖方法推广了仅考虑确定性硬约束的已有工作,并取得了 SOTA 性能。
引用
@article{arxiv.2202.10407,
title = {Learning Behavioral Soft Constraints from Demonstrations},
author = {Arie Glazier and Andrea Loreggia and Nicholas Mattei and Taher Rahgooy and Francesca Rossi and Brent Venable},
journal= {arXiv preprint arXiv:2202.10407},
year = {2022}
}
备注
arXiv admin note: substantial text overlap with arXiv:2109.11018