轨迹优先:一种用于发现多样性策略的课程
机器学习
2026-05-13 v3 机器人学
摘要
能够以多种方式解决任务使得智能体对任务变化更具鲁棒性,且更不易陷入局部最优。在此背景下,受约束多样性优化已成为并行训练一组多样性智能体的有用强化学习(RL)框架。然而,现有的受约束多样性 RL 方法在机器人操作等复杂任务中往往探索不足,导致行为多样性受限。我们通过一种两阶段课程来解决这一问题:在初始阶段引入基于样条(spline)的轨迹先验作为归纳偏置,以产生多样且高奖励的行为;在第二阶段将这些行为蒸馏为反应式的逐步策略。在我们的实证评估中,我们提供了关于多样性导向训练挑战的新见解,并表明我们的课程在保持高任务性能的同时增加了所学技能的多样性。
引用
@article{arxiv.2506.01568,
title = {Trajectory First: A Curriculum for Discovering Diverse Policies},
author = {Cornelius V. Braun and Sayantan Auddy and Marc Toussaint},
journal= {arXiv preprint arXiv:2506.01568},
year = {2026}
}
备注
Accepted into the Inductive Biases in Reinforcement Learning Workshop at RLC 2025