中文

VCD:用于图像中视觉常识发现的数据集

计算机视觉与模式识别 2025-06-06 v2 人工智能

摘要

视觉常识在理解和推理视觉世界方面发挥着至关重要的作用。虽然 ConceptNet 等常识知识库提供了结构化的一般事实集合,但它们缺乏视觉落地的表示。像 Visual Genome 这样的场景图数据集虽然富含对象级描述,但主要关注直接可观察的信息,缺乏对常识知识的系统分类。我们提出了视觉常识数据集 (VCD),这是一个包含超过 100,000 张图像和 1400 万个对象 - 常识对的大规模数据集,填补了这一空白。VCD 引入了一种新颖的三级视觉常识分类法,整合了属性、动作和空间方面的“可见”(直接可观察)和“不可见”(可推断)常识。每个常识表示为一个三元组,其中头实体落地到图像中的对象边界框,从而实现依赖于场景和特定对象的视觉常识表示。为了展示 VCD 的实用性,我们开发了 VCM,这是一种结合视觉 - 语言模型与指令微调的生成模型,用于从图像中发现多样的视觉常识。广泛的评估证明了 VCD 的高质量及其作为推进视觉落地常识理解与推理资源的价值。我们的数据集和代码将在 https://github.com/NUSTM/VCD 发布。

关键词

引用

@article{arxiv.2402.17213,
  title  = {VCD: A Dataset for Visual Commonsense Discovery in Images},
  author = {Xiangqing Shen and Fanfan Wang and Siwei Wu and Rui Xia},
  journal= {arXiv preprint arXiv:2402.17213},
  year   = {2025}
}