中文

当动态变化时,鲁棒任务推断获胜:基于行为基础模型的离线模仿学习

机器学习 2026-05-19 v1 人工智能

摘要

行为基础模型 (BFM) 通过预训练任务无关的表示来实现可扩展的模仿学习 (IL),后者可快速适应新任务。然而,现有的 BFM 假设环境动力学是固定的,这限制了其在真实世界变化(如摩擦、执行或传感器噪声变化)下的鲁棒性。我们通过将 BFM 任务推断形式化为鲁棒 minimax 优化问题,实现了对最坏情况动力学扰动的适应,而无需修改预训练。这一方法是已知第一个在仅依赖单个名义环境离线数据的情况下实现动力学变化鲁棒性的 BFM 框架。我们的做法在动力学变化下显著优于标准 BFM 和鲁棒离线 IL 基线。这些结果表明,鲁棒策略完全可以在任务推断阶段实现,从而提高了 BFM 在动态环境中的实用性。

关键词

引用

@article{arxiv.2605.17017,
  title  = {When Dynamics Shift, Robust Task Inference Wins: Offline Imitation Learning with Behavior Foundation Models Revisited},
  author = {Rishabh Agrawal and Rahul Jain and Ashutosh Nayyar},
  journal= {arXiv preprint arXiv:2605.17017},
  year   = {2026}
}