通过外在行为好奇心实现策略行为多样化
机器学习
2025-08-15 v4 人工智能
摘要
模仿学习(IL)在多种应用中(例如机器人运动)显示出潜力,但通常局限于学习单一专家策略,限制了在不可预测的真实世界场景中的行为多样性和鲁棒性。为了解决这个问题,我们引入了质量多样性逆强化学习(QD-IRL),这是一个新颖的框架,它将质量多样性优化与IRL方法相结合,使智能体能够从有限的演示中学习多样化的行为。这项工作引入了外在行为好奇心(EBC),它允许智能体根据行为相对于大型行为档案的新颖程度,从外部评判者那里获得额外的好奇心奖励。为了验证EBC在探索多样化运动行为方面的有效性,我们在多个机器人运动任务上评估了我们的方法。EBC将结合GAIL、VAIL和DiffAIL的QD-IRL实例在所有包含的环境中的性能分别提升了高达185%、42%和150%,甚至在Humanoid任务中超越了专家性能20%。此外,我们证明了EBC适用于基于梯度树的质量多样性强化学习(QD-RL)算法,显著提升了其性能,并为学习行为多样化策略提供了一种通用技术。本工作的源代码可在 https://github.com/vanzll/EBC 获取。
引用
@article{arxiv.2410.06151,
title = {Diversifying Policy Behaviors with Extrinsic Behavioral Curiosity},
author = {Zhenglin Wan and Xingrui Yu and David Mark Bossens and Yueming Lyu and Qing Guo and Flint Xiaofeng Fan and Yew Soon Ong and Ivor Tsang},
journal= {arXiv preprint arXiv:2410.06151},
year = {2025}
}
备注
20 pages, conference paper