中文

MMCOMET:用于语境推理的大规模多模态常识知识图谱

人工智能 2026-03-03 v1

摘要

我们提出了 MMCOMET,是首个集成物理、社会和事件性知识的多模态常识知识图谱(MMKG)。 MMCOMET 通过一种高效图像检索过程,将视觉维度扩展到 ATOMIC2020 知识图谱,生成超过 90 万个多模态三元组。 该新资源解决了现有 MMKG 在支持复杂推理任务(如图像描述生成和讲故事)方面的主要局限性。 通过标准的视觉讲故事实验,我们展示了该方法能够生成比仅使用文本知识更丰富、连贯且语境明确的故事。 该资源为多模态常识推理和叙事生成建立了新的基础。

关键词

引用

@article{arxiv.2603.01055,
  title  = {MMCOMET: A Large-Scale Multimodal Commonsense Knowledge Graph for Contextual Reasoning},
  author = {Eileen Wang and Hiba Arnaout and Dhita Pratama and Shuo Yang and Dangyang Liu and Jie Yang and Josiah Poon and Jeff Pan and Caren Han},
  journal= {arXiv preprint arXiv:2603.01055},
  year   = {2026}
}