中文

全视项目 V2:迈向开放世界的通用关系理解

计算机视觉与模式识别 2024-08-26 v4

摘要

我们推出了全视项目 V2:一种专为理解图像中物体关系而设计的新模型和数据集。具体而言,我们提出了全视模型 V2 (ASMv2),它将文本生成、物体定位和关系理解的公式整合到一个关系对话(ReC)任务中。利用这一统一任务,我们的模型不仅在感知和识别图像中的所有物体方面表现出色,还能掌握它们之间复杂的关系图,减少了多模态大型语言模型(MLLMs)中常见的关系幻觉。为了促进 MLLMs 在关系理解方面的训练和评估,我们创建了第一个高质量 ReC 数据集 (AS-V2),其格式与标准指令微调数据对齐。此外,我们设计了一个名为基于循环的关系探测评估(CRPE)的新基准,用于全面评估 MLLMs 的关系理解能力。值得注意的是,我们的 ASMv2 在这个关系感知基准上达到了 52.04 的整体准确率,大幅超越了 LLaVA-1.5 的 43.14。我们希望我们的工作能激发更多未来研究,并促进向通用人工智能的演进。我们的项目发布于 https://github.com/OpenGVLab/all-seeing。

关键词

引用

@article{arxiv.2402.19474,
  title  = {The All-Seeing Project V2: Towards General Relation Comprehension of the Open World},
  author = {Weiyun Wang and Yiming Ren and Haowen Luo and Tiantong Li and Chenxiang Yan and Zhe Chen and Wenhai Wang and Qingyun Li and Lewei Lu and Xizhou Zhu and Yu Qiao and Jifeng Dai},
  journal= {arXiv preprint arXiv:2402.19474},
  year   = {2024}
}

备注

Accepted to ECCV2024 main conference