从次优演示中半监督模仿学习团队策略
人工智能
2022-09-21 v6 机器学习
多智能体系统
摘要
我们提出贝叶斯团队模仿学习器 (BTIL),一种用于建模马尔可夫域中执行序贯任务的团队行为的模仿学习算法。与现有多智能体模仿学习技术不同,BTIL 显式建模并推断团队成员随时间变化的心理状态,从而能够从次优团队合作的演示中学习分散式团队策略。此外,为从小数据集中实现样本高效与标签高效的策略学习,BTIL 采用贝叶斯视角,并能够从半监督演示中学习。我们在合成多智能体任务以及一个新的智能体-人类团队合作数据集上展示并基准测试了 BTIL 的性能。我们的实验表明,尽管团队成员(时变且可能未对齐的)心理状态对其行为有影响,BTIL 仍能从演示中成功学习团队策略。
引用
@article{arxiv.2205.02959,
title = {Semi-Supervised Imitation Learning of Team Policies from Suboptimal Demonstrations},
author = {Sangwon Seo and Vaibhav V. Unhelkar},
journal= {arXiv preprint arXiv:2205.02959},
year = {2022}
}
备注
Extended version of an identically-titled paper accepted at IJCAI 2022