基于行为基础模型的快速适应
机器学习
2025-04-11 v1 人工智能
机器人学
摘要
无监督零样本强化学习 (RL) 已成为预训练行为基础模型 的强大范式,使智能体能够以零样本方式(即无需额外的测试时学习或规划)解决通过奖励函数指定的各种下游任务。这是通过学习自监督任务嵌入以及相应的近最优行为,并结合一个推理过程来直接检索任意给定奖励函数的潜在任务嵌入及相关策略来实现的。尽管取得了有希望的结果,但由于无监督训练过程、嵌入和推理过程引起的误差,零样本策略通常是次优的。在本文中,我们专注于设计快速适应策略,在与环境进行几步在线交互中提高 BFM 的零样本性能,同时避免在适应过程中出现性能下降。值得注意的是,我们证明了现有的 BFM 学习到的一组技能包含了比其推理过程所识别的策略性能更高的策略,使其非常适合快速适应。受此观察启发,我们提出了 actor-critic 和仅 actor 快速适应策略,这些策略在预训练 BFM 的低维任务嵌入空间中进行搜索,以快速提高其在任意下游任务上的零样本策略性能。值得注意的是,我们的方法减轻了微调预训练 RL 模型时通常观察到的初始“遗忘”阶段。我们在多个导航和运动领域评估了四种最先进的零样本 RL 方法基础上的快速适应策略。结果表明,它们在几十个回合内实现了比其零样本性能 10-40% 的提升,优于现有基线。
引用
@article{arxiv.2504.07896,
title = {Fast Adaptation with Behavioral Foundation Models},
author = {Harshit Sikchi and Andrea Tirinzoni and Ahmed Touati and Yingchen Xu and Anssi Kanervisto and Scott Niekum and Amy Zhang and Alessandro Lazaric and Matteo Pirotta},
journal= {arXiv preprint arXiv:2504.07896},
year = {2025}
}
备注
25 pages