中文

FoMo 奖励:我们能否将基础模型转化为奖励函数?

机器学习 2023-12-08 v1 人工智能

摘要

我们探讨了将基础模型转化为强化学习的通用奖励函数的可行性。为此,我们提出了一种将现成的视觉模型与大型语言模型对接的简单流水线。具体而言,给定一系列观测轨迹,我们推断出描述用户希望智能体执行任务的指令的似然性。我们表明,这种通用的似然函数展现出了奖励函数理想预期应具备的特征:它为期望行为赋予高值,为若干相似但不正确的策略赋予低值。总体而言,我们的工作开辟了通过基础模型为交互式任务设计开放式智能体的可能性。

关键词

引用

@article{arxiv.2312.03881,
  title  = {FoMo Rewards: Can we cast foundation models as reward functions?},
  author = {Ekdeep Singh Lubana and Johann Brehmer and Pim de Haan and Taco Cohen},
  journal= {arXiv preprint arXiv:2312.03881},
  year   = {2023}
}

备注

Accepted to NeurIPS FMDM workshop