中文

通过示范学习在约束环境中做出类人权衡

人工智能 2021-09-24 v1 机器学习 机器人学

摘要

许多现实场景要求人类做出艰难权衡:我们是否总是遵守所有交通规则,还是在紧急情况下超速?这些场景迫使我们评估集体规范与自身个人目标之间的权衡。为建立有效的人机团队,我们必须赋予 AI 智能体一个关于人类在复杂约束环境中如何权衡的模型。这些智能体将能够镜像人类行为,或将人类注意力吸引到可改进决策的情境中。为此,我们提出了一种新颖的逆强化学习(IRL)方法,用于从示范中学习隐式硬约束与软约束,使智能体快速适应新设置。此外,对状态、动作和状态特征学习软约束,使智能体能将此知识迁移到具有相似方面的新领域。我们随后使用该约束学习方法实现一种新颖的系统架构,其利用人类决策的认知模型——多选项决策场理论(MDFT)——来协调相互竞争的目标。我们在轨迹长度、违反约束数和总回报上评估所得智能体,证明我们的智能体架构兼具通用性并取得强劲性能。从而我们能够在约束不显式的环境中从示范捕获并复现类人权衡。

关键词

引用

@article{arxiv.2109.11018,
  title  = {Making Human-Like Trade-offs in Constrained Environments by Learning from Demonstrations},
  author = {Arie Glazier and Andrea Loreggia and Nicholas Mattei and Taher Rahgooy and Francesca Rossi and K. Brent Venable},
  journal= {arXiv preprint arXiv:2109.11018},
  year   = {2021}
}