中文

基于异构演示的层次化模仿学习团队行为

机器学习 2025-02-26 v1 人工智能 多智能体系统

摘要

成功的协作需要团队成员保持一致,尤其在复杂的序列任务中。团队成员必须动态协调各子任务的执行顺序。然而,部分可观测性和有限的通信带宽等现实约束常导致协作次优。即便在专家团队中,同一任务也可能以多种方式执行。为了开发面向复杂序列任务的多智能体系统和人类-人工智能团队,我们致力于数据驱动的多模态团队行为学习。多智能体模仿学习(Multi-Agent Imitation Learning, MAIL)为从演示中学习团队行为提供了可行框架,但现有方法在处理异构演示时存在挑战,因为它们假设所有演示都来源于单一团队策略。为此,本文引入了 DTIL:一种为复杂序列任务中学习多模态团队行为而设计的层次化 MAIL 算法。DTIL 将每个团队成员表示为层次化策略,并以因式方式从异构团队演示中学习这些策略。通过采用分布匹配方法,DTIL 能有效缓解误差的叠加效应,并在长时间尺度和连续状态表示下具有良好的扩展性。实验结果表明,DTIL 在多种协作情景下均优于 MAIL 基线方法,能够准确地建模团队行为。

关键词

引用

@article{arxiv.2502.17618,
  title  = {Hierarchical Imitation Learning of Team Behavior from Heterogeneous Demonstrations},
  author = {Sangwon Seo and Vaibhav Unhelkar},
  journal= {arXiv preprint arXiv:2502.17618},
  year   = {2025}
}

备注

Extended version of an identically-titled paper accepted at AAMAS 2025