MMCOMET:用于语境推理的大规模多模态常识知识图谱
人工智能
2026-03-03 v1
摘要
我们提出了 MMCOMET,是首个集成物理、社会和事件性知识的多模态常识知识图谱(MMKG)。 MMCOMET 通过一种高效图像检索过程,将视觉维度扩展到 ATOMIC2020 知识图谱,生成超过 90 万个多模态三元组。 该新资源解决了现有 MMKG 在支持复杂推理任务(如图像描述生成和讲故事)方面的主要局限性。 通过标准的视觉讲故事实验,我们展示了该方法能够生成比仅使用文本知识更丰富、连贯且语境明确的故事。 该资源为多模态常识推理和叙事生成建立了新的基础。
引用
@article{arxiv.2603.01055,
title = {MMCOMET: A Large-Scale Multimodal Commonsense Knowledge Graph for Contextual Reasoning},
author = {Eileen Wang and Hiba Arnaout and Dhita Pratama and Shuo Yang and Dangyang Liu and Jie Yang and Josiah Poon and Jeff Pan and Caren Han},
journal= {arXiv preprint arXiv:2603.01055},
year = {2026}
}