Thinker:面向具身智能的视觉-语言基础模型
计算机视觉与模式识别
2026-01-30 v1 人工智能
摘要
当大型视觉-语言模型被应用于机器人领域时,会遇到一些对人类而言简单却对模型而言容易出错的问题。例如,模型容易混淆第三人称视角与第一人称视角,或倾向于忽略视频结尾处的信息进行时间推理。为此,我们提出了 Thinker,一个为具身智能设计的大型视觉-语言基础模型。我们从两个角度解决上述问题。首先,我们构建了一个专为机器人感知与推理而设计的大规模数据集,涵盖自我视角视频、视觉锚定、空间理解和链式思考数据。其次,我们引入一种简单且有效的方法,通过同时将关键帧和完整视频序列作为输入,大幅提升了模型进行视频理解的能力。我们的模型在两个最常用的任务规划基准数据集上实现了最先进的成绩。
引用
@article{arxiv.2601.21199,
title = {Thinker: A vision-language foundation model for embodied intelligence},
author = {Baiyu Pan and Daqin Luo and Junpeng Yang and Jiyuan Wang and Yixuan Zhang and Hailin Shi and Jichao Jiao},
journal= {arXiv preprint arXiv:2601.21199},
year = {2026}
}
备注
IROS 2025, 4 pages, 3 figures