利用基础模型引导技能发现
人工智能
2025-10-28 v1
摘要
学习无需手工设计奖励函数的多样化技能,可能加速下游任务中的强化学习。然而,现有的技能发现方法仅关注最大化技能的多样性,而不考虑人类偏好,这会导致不可取的行为,甚至可能危险的技能。例如,使用先前方法训练的猎豹机器人会学习在所有方向上滚动,以最大化技能的多样性,而我们更希望它跑步,而不会翻转或进入危险区域。本文提出了一种基于基础模型的引导技能发现方法 (FoG),通过基础模型将人类意图融入技能发现中。具体而言,FoG 从基础模型中提取评分函数,用于基于人类意图评估状态,将有益的状态赋予更高的分数,不利的状态赋予更低的分数。然后,这些分数用于重新加权技能发现算法的奖励。通过优化重新加权后的技能发现奖励,FoG 成功地学习了消除不可取行为(如翻转或滚动),并在基于状态和基于像素的任务中避免危险区域。有趣的是,我们展示了 FoG 能够发现难以定义的行为技能。可供交互式可视化的链接为 https://sites.google.com/view/submission-fog。
引用
@article{arxiv.2510.23167,
title = {Guiding Skill Discovery with Foundation Models},
author = {Zhao Yang and Thomas M. Moerland and Mike Preuss and Aske Plaat and Vincent François-Lavet and Edward S. Hu},
journal= {arXiv preprint arXiv:2510.23167},
year = {2025}
}