中文

DenseWorld-1M: 面向现实世界的详细稠密 grounding 描述

计算机视觉与模式识别 2025-07-01 v1

摘要

多模态大语言模型(MLLM) demonstrate 了对场景的复杂理解,这有助于来自大规模高质量数据集的益处。大多数现有描述数据集缺乏视觉实体的 ground 位置和关系。Several grounded caption 数据集面临缺乏详细描述、关系以及高分辨率图像中大量对象描述的问题。为填补这一对社区的空白,我们提出 DenseWorld-1M,这是第一个在现实世界中出现的大规模、详细、稠密 ground 描述数据集。我们设计了一个三阶段标注管线,包含开放式感知、详细对象描述生成和稠密描述合并。第一个阶段获得实体级别的掩码和标签。第二个阶段在第一个阶段提供的掩码和标签的指导下,生成对象级别的详细描述。最终阶段将对象描述和掩码合并为空间和关系稠密描述。为加速标注过程并提高描述质量,我们提出了两个 VLM 模型:Detailed Region Caption 模型和 Spatial Caption 合并模型。在各种设置包括视觉语言理解、视觉 grounding 和区域描述生成等方面的大量实验表明,我们的 DenseWorld-1M 数据集和标注模型的有效性。

关键词

引用

@article{arxiv.2506.24102,
  title  = {DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World},
  author = {Xiangtai Li and Tao Zhang and Yanwei Li and Haobo Yuan and Shihao Chen and Yikang Zhou and Jiahao Meng and Yueyi Sun and Shilin Xu and Lu Qi and Tianheng Cheng and Yi Lin and Zilong Huang and Wenhao Huang and Jiashi Feng and Guang Shi},
  journal= {arXiv preprint arXiv:2506.24102},
  year   = {2025}
}

备注

Datasets and Models: https://github.com/lxtGH/DenseWorld-1M