群体行为克隆
人工智能
2024-12-11 v1
摘要
在序列决策环境中,训练智能体的主要方法是强化学习(RL)和模仿学习(IL)。与依赖建模奖励函数的RL不同,IL利用专家演示,其中专家策略(例如人类)提供期望行为。形式上,提供一个状态-动作对数据集:。IL中一种常见技术是行为克隆(BC),通过基于的监督学习学习策略。通过使用个独立训练的BC策略的集成,可以进一步提升性能。集成在给定状态下的动作是个动作的聚合输出:。本文解决动作差异增大这一问题——即个预测动作之间的差异在训练数据中代表性不足的状态中不断增大。较大的动作差异可能导致次优的聚合动作。为解决此问题,我们提出了一种方法,在保留计算多样性的同时促进策略之间更大的一致性。该方法减少了动作差异,并确保集成保留其固有优势,如鲁棒性和多样化决策。我们在八个多样化环境中评估了我们的方法,结果表明动作差异显著降低,整体性能(以平均回合回报衡量)显著提升。
引用
@article{arxiv.2412.07617,
title = {Swarm Behavior Cloning},
author = {Jonas Nüßlein and Maximilian Zorn and Philipp Altmann and Claudia Linnhoff-Popien},
journal= {arXiv preprint arXiv:2412.07617},
year = {2024}
}
备注
Accepted at ICAART 2025