人类-人工智能协作中的嵌套训练:相互适应
机器人学
2026-02-23 v1 机器学习
多智能体系统
摘要
人类-人工智能协作中的相互适应是一大挑战,因为人类会自然地调整策略以应对机器人的策略。现有方法旨在通过多样化训练合作伙伴来逼近人类行为,但这些合作伙伴是静态的,无法捕捉人类自适应行为的特征。让机器人暴露于自适应行为中至关重要,但当两位智能体在多智能体环境中同时学习时,他们常会收敛于仅与其共同训练的智能体才能工作的晦涩隐式协调策略。此类智能体在与新合作伙伴配对时难以泛化。为捕捉人类的自适应行为,我们将人类-机器人协作场景建模为交互式部分可观测马尔可夫决策过程(I-POMDP),显式地将人类的适应性建模为状态的一部分。我们提出一种嵌套训练方案,以近似求解有限层次 I-POMDP 的方法。在此框架下,各层次的智能体针对次层次中自适应智能体进行训练。这确保了 ego 智能体在训练过程中暴露于自适应行为,同时由于训练合作伙伴本身不在学习,因此避免了隐式协调策略的出现。我们在 Overcooked 域中进行多 episode、强制协作设置下的训练,比较了若干为人类-机器人协作设计的基线智能体。我们评估了该方法在与训练期间未见过的自适应合作伙伴配对时的性能。我们的实验结果表明,该方法不仅在与这些自适应合作伙伴方面实现了更高的任务性能,还在团队互动期间展现了显著更大的适应性。
引用
@article{arxiv.2602.17737,
title = {Nested Training for Mutual Adaptation in Human-AI Teaming},
author = {Upasana Biswas and Durgesh Kalwar and Subbarao Kambhampati and Sarath Sreedharan},
journal= {arXiv preprint arXiv:2602.17737},
year = {2026}
}