中文

正则化潜在动态预测是行为基础模型的强基准

人工智能 2026-03-18 v1 机器学习 机器人学

摘要

行为基础模型(BFM)能够为代理提供适应任何未知奖励或任务的能力。然而,这些方法只能产生针对处于某些预存在状态特征范围内的奖励函数的近最优政策,这使得状态特征的选择对BFM的表达性至关重要。结果是,BFM使用各种复杂的目标函数进行训练,需要充足的数据覆盖才能训练出有用且可跨任务的特征。在本工作中,我们检讨了这样一个问题:这些复杂的表示学习目标对于零样本RL是否必要?具体地,我们重新审视了自监督下一状态预测在潜在空间中的状态特征学习目标,但注意到这种目标本身容易增加状态特征之间的相似性,从而随后减少跨度。我们提出一种方法,即正则化潜在动态预测(RLDP),通过添加简单的正交正则化来保持特征多样性,并在零样本RL中达到或超过最先进的复杂表示学习方法。此外,我们经验性地表明,先前方法在低覆盖场景下表现不佳,而RLDP仍然成功。

关键词

引用

@article{arxiv.2603.15857,
  title  = {Regularized Latent Dynamics Prediction is a Strong Baseline For Behavioral Foundation Models},
  author = {Pranaya Jajoo and Harshit Sikchi and Siddhant Agarwal and Amy Zhang and Scott Niekum and Martha White},
  journal= {arXiv preprint arXiv:2603.15857},
  year   = {2026}
}

备注

ICLR 2026