中文

作为成功检测器的视觉-语言模型

计算机视觉与模式识别 2023-03-14 v1 人工智能 机器学习

摘要

检测成功行为对于训练智能体至关重要。因此,可泛化的奖励模型是能够学会泛化其行为的智能体的先决条件。在本工作中,我们专注于开发鲁棒的成功检测器,其利用大型预训练视觉-语言模型(Flamingo,Alayrac et al. (2022))与人类奖励标注。具体而言,我们将成功检测视为一个视觉问答(VQA)问题,记为 SuccessVQA。我们研究了跨三个差异显著领域的成功检测:(i)模拟家庭中的交互式语言条件智能体,(ii)真实世界机器人操纵,以及(iii)“野外”人类自我中心视频。我们在前两个领域中考察了基于 Flamingo 的成功检测模型在未见语言与视觉变化下的泛化特性,并发现所提方法在分布外测试场景中面对任一变化时均能优于定制奖励模型。在最后的“野外”人类视频领域,我们表明对未见真实视频的成功检测是一项更具挑战性的泛化任务,有待未来工作。我们希望初步结果能鼓励在真实世界成功检测与奖励建模方面的进一步工作。

关键词

引用

@article{arxiv.2303.07280,
  title  = {Vision-Language Models as Success Detectors},
  author = {Yuqing Du and Ksenia Konyushkova and Misha Denil and Akhil Raju and Jessica Landon and Felix Hill and Nando de Freitas and Serkan Cabi},
  journal= {arXiv preprint arXiv:2303.07280},
  year   = {2023}
}