中文

面向行为基础模型的乐观任务推断

机器学习 2026-03-03 v2

摘要

行为基础模型(BFM)能够检索任何在测试时直接指定的奖励函数的高性能策略,通常称为零样图强化学习(RL)。虽然这种方法在计算上非常高效,但在数据方面则相对低效:标准假设下,BFM需要在规模非平凡的推断数据集上计算奖励,假设要么获得奖励函数的函数形式,要么需要大量标注工作。为缓解这些限制,我们通过在测试时与环境的交互来解决任务推断问题。我们提出OpTI-BFM,一种乐观决策准则,直接建模奖励函数上的不确定性,并指导BFM在任务推断中进行数据收集。形式上,我们通过与上置置信算法直接关联,为训练良好的BFM提供了一次 regret 界。经验上,我们在既定的零样图基准测试中评估了OpTI-BFM,观察到它使后继特征基于的BFM能够在少量剧集中以最小计算开销识别并优化未出现的奖励函数。代码可在 https://github.com/ThomasRupf/opti-bfm 查看。

关键词

引用

@article{arxiv.2510.20264,
  title  = {Optimistic Task Inference for Behavior Foundation Models},
  author = {Thomas Rupf and Marco Bagatella and Marin Vlastelica and Andreas Krause},
  journal= {arXiv preprint arXiv:2510.20264},
  year   = {2026}
}

备注

ICLR 2026