中文

面向稳健人机协作的伙伴感知层次技能发现

人工智能 2026-05-26 v1

摘要

多智能体协作,特别是人机协作,需要能够适应不同且动态行为的伙伴的智能体。传统的深度层次强化学习 (DHRL) 方法关注代理中心的奖励,忽视伙伴行为,导致捷足身权的学习,即技能利用虚假信息而非适应伙伴动态行为。这种限制削弱了代理适应和有效协调不同伙伴的能力。我们引入伙伴感知技能发现 (PASD),一种条件于伙伴行为的 DHRL 框架。PASD 引入对比内在奖励来捕捉源自伙伴交互中产生的模式,使类似伙伴的技能表示保持一致,同时在不同策略之间保持可区分性。通过基于伙伴交互结构技能空间,PASD 缓解了捷足身权的学习,促进了行为一致性,实现稳健且自适应的协调。我们在 Overcooked-AI 基准上进行了广泛评估,该基准包含由技能水平和游戏风格各异的伙伴。我们进一步使用来自人类-人类游戏轨迹训练的人类代理模型进行评估。PASD 在各种伙伴行为上 consistently 超越现有的基于人口的和层次基线,展示了可迁移的技能学习,能够在广泛的伙伴行为范围内泛化。分析所学技能表示表明,PASD 能有效适应不同伙伴行为,凸显其在人机协作中的鲁棒性。

关键词

引用

@article{arxiv.2605.24352,
  title  = {Partner-Aware Hierarchical Skill Discovery for Robust Human-AI Collaboration},
  author = {Adnan Ahmad and Bahareh Nakisa and Mohammad Naim Rastgoo},
  journal= {arXiv preprint arXiv:2605.24352},
  year   = {2026}
}