中文

使用逆向强化学习的多目标约束推断

人工智能 2026-05-11 v1 机器学习 多智能体系统

摘要

通过观察专家演示,约束推断被广泛认为是使强化学习智能体符合安全边界与操作准则的关键。然而,现有方法通常假设同质演示(即由单个专家或具有相同目标的多个专家生成)。它们捕捉个体偏好的能力也有限,且常常存在计算效率低下的问题。在本文中,我们引入了多目标约束推断(MOCI),这是一种新颖的框架,旨在从多个专家追求不同目标的异构专家轨迹中联合提取共享约束与个体偏好。MOCI 能够有效地建模并学习多样化且潜在冲突的行为。实证评估表明,MOCI 显著优于现有基线,取得了更高的预测性能,并在标准网格世界基准上保持了具竞争力的计算效率。这些结果确立了 MOCI 作为一种准确、灵活且计算上实用的方法,适用于现实世界的约束推断与偏好学习任务。

关键词

引用

@article{arxiv.2605.06951,
  title  = {Multi-Objective Constraint Inference using Inverse reinforcement learning},
  author = {Syed Ihtesham Hussain Shah and Floris den Hengst and Aneta Lisowska and Annette ten Teije},
  journal= {arXiv preprint arXiv:2605.06951},
  year   = {2026}
}