中文

EgoThink:评测视觉语言模型的第一人称视角思考能力

计算机视觉与模式识别 2024-03-29 v2 计算与语言

摘要

视觉语言模型(vision-language models, VLMs)近来在传统下游任务中展现出有前景的结果。评估研究已经出现以衡量它们的能力,其中大多数聚焦于第三人称视角,仅有少数涉及第一人称视角下的特定任务。然而,VLMs从第一人称视角“思考”的能力——这是推进自主智能体与机器人技术的关键属性——在很大程度上仍未被探索。为弥补这一研究空白,我们引入了EgoThink,一种新颖的视觉问答基准,涵盖六项核心能力与十二个细致维度。该基准使用从第一人称视频中选取的片段构建,带有包含第一人称信息的手动标注问答对。为全面评估VLMs,我们在EgoThink上评测了十八个流行的VLMs。此外,鉴于答案为开放形式,我们使用GPT-4作为自动评判器来计算单答案评分。实验结果表明,尽管GPT-4V在众多维度上领先,所有被评估的VLMs在第一人称视角任务中仍具有相当大的改进潜力。同时,增大可训练参数数量对模型在EgoThink上的性能影响最为显著。总之,EgoThink是对现有VLMs评估基准的宝贵补充,为具身人工智能与机器人领域的未来研究提供了不可或缺的资源。

关键词

引用

@article{arxiv.2311.15596,
  title  = {EgoThink: Evaluating First-Person Perspective Thinking Capability of Vision-Language Models},
  author = {Sijie Cheng and Zhicheng Guo and Jingwen Wu and Kechen Fang and Peng Li and Huaping Liu and Yang Liu},
  journal= {arXiv preprint arXiv:2311.15596},
  year   = {2024}
}