中文

基于失败提示词的视频-语言模型适应通用机器人奖励

计算机视觉与模式识别 2024-07-23 v1 机器人学

摘要

对于通用机器人在现实世界中能够执行各种环境下的广泛指令至关重要,其核心在于可 generalizing 的奖励函数。近期在视觉语言模型(如 CLIP)领域取得的进展为开放域视觉识别铺平了道路。然而,收集机器人在多种环境下执行各种语言指令的数据仍具有挑战性。本文旨在将具备强大 generalization 能力的视频-语言模型转化为可 generalization 的语言条件奖励函数,仅利用单个环境中少量任务的机器人视频数据。不同于常规机器人数据集,人类视频-语言数据很少包含平凡的失败视频。为增强模型区分成功与失败执行的能力,我们聚类失败视频特征,使模型能够识别其中的模式。对于每个聚类,我们将新训练的失败提示词集成到文本编码器中,以表示相应的失败模式。我们的语言条件奖励函数在机器人规划和强化学习中对新环境和新指令表现出色的 generalization 能力。

关键词

引用

@article{arxiv.2407.14872,
  title  = {Adapt2Reward: Adapting Video-Language Models to Generalizable Robotic Rewards via Failure Prompts},
  author = {Yanting Yang and Minghao Chen and Qibo Qiu and Jiahao Wu and Wenxiao Wang and Binbin Lin and Ziyu Guan and Xiaofei He},
  journal= {arXiv preprint arXiv:2407.14872},
  year   = {2024}
}

备注

ECCV 2024 camera-ready