中文

群体行为克隆

人工智能 2024-12-11 v1

摘要

在序列决策环境中,训练智能体的主要方法是强化学习(RL)和模仿学习(IL)。与依赖建模奖励函数的RL不同,IL利用专家演示,其中专家策略πe\pi_e(例如人类)提供期望行为。形式上,提供一个状态-动作对数据集DDD=(s,a=πe(s))D = {(s, a = \pi_e(s))}。IL中一种常见技术是行为克隆(BC),通过基于DD的监督学习学习策略π(s)=a\pi(s) = a。通过使用NN个独立训练的BC策略的集成E=πi(s)1iNE = {\pi_i(s)}{1 \leq i \leq N},可以进一步提升性能。集成在给定状态ss下的动作aaNN个动作的聚合输出:a=1Niπi(s)a = \frac{1}{N} \sum{i} \pi_i(s)。本文解决动作差异增大这一问题——即NN个预测动作之间的差异在训练数据中代表性不足的状态中不断增大。较大的动作差异可能导致次优的聚合动作。为解决此问题,我们提出了一种方法,在保留计算多样性的同时促进策略之间更大的一致性。该方法减少了动作差异,并确保集成保留其固有优势,如鲁棒性和多样化决策。我们在八个多样化环境中评估了我们的方法,结果表明动作差异显著降低,整体性能(以平均回合回报衡量)显著提升。

关键词

引用

@article{arxiv.2412.07617,
  title  = {Swarm Behavior Cloning},
  author = {Jonas Nüßlein and Maximilian Zorn and Philipp Altmann and Claudia Linnhoff-Popien},
  journal= {arXiv preprint arXiv:2412.07617},
  year   = {2024}
}

备注

Accepted at ICAART 2025