中文

感知、定位、推理与行动:面向通用视觉表示的基准测试

计算机视觉与模式识别 2022-11-29 v1 人工智能

摘要

与人类视觉系统不同,当前的计算机视觉模型尚无法实现通用的视觉理解。现有创建通用视觉模型的努力在评估任务的范围上受限,且未提供一个整体框架来全面执行这些任务。我们提出了一个新的综合基准测试——通用视觉理解评估(G-VUE),它涵盖了视觉认知能力的全谱,包含四个功能领域——感知、定位、推理和行动。这四个领域体现在11个精心策划的任务中,从三维重建到视觉推理和操作。伴随该基准,我们提供了一个通用的编码器-解码器框架,允许在所有11个任务上评估任意的视觉表示。我们使用该框架评估了各种预训练的视觉表示,并观察到:(1)在G-VUE上,基于Transformer的视觉骨干网络通常优于基于CNN的骨干网络;(2)来自视觉-语言预训练的视觉表示在各项视觉任务中均优于仅进行视觉预训练的视觉表示。通过G-VUE,我们提供了一个整体评估标准,以激励通过获取更通用的视觉表示来构建通用视觉系统的研究。

关键词

引用

@article{arxiv.2211.15402,
  title  = {Perceive, Ground, Reason, and Act: A Benchmark for General-purpose Visual Representation},
  author = {Jiangyong Huang and William Yicheng Zhu and Baoxiong Jia and Zan Wang and Xiaojian Ma and Qing Li and Siyuan Huang},
  journal= {arXiv preprint arXiv:2211.15402},
  year   = {2022}
}