中文

Hybrid-DMKG:面向多模态多跳问答的数据驱动知识图谱推理框架

人工智能 2025-12-02 v1

摘要

多模态知识编辑(MKE)将传统知识编辑扩展到包含文本和视觉两种模态的场景,但现有 MKE 基准主要评估最终答案的正确性,忽略中间推理质量以及对视觉改写输入的鲁棒性。为此,我们引入 MMQAKE,首个针对多模态多跳问答进行知识编辑的基准测试。MMQAKE 评估(1)模型在跨文本和图像的 2-5 跳事实链上的推理能力,包括每个中间步骤的性能;(2)对多跳问题中视觉改写输入的鲁棒性。我们的评估显示,当前 MKE 方法在知识编辑后难以在多模态推理链上保持一致的更新与推理。为此,我们提出 Hybrid-DMKG,基于动态多模态知识图谱(DMKG)构建的混合推理框架,以实现对更新后多模态知识的准确多跳推理。Hybrid-DMKG 首先使用大语言模型将多模态多跳问题分解为顺序子问题,然后应用多模态检索模型通过联合编码每个子问题与候选实体及其关联图像来定位更新后的事实。对于答案推断,混合推理模块通过两个平行路径在 DMKG 上运行:(1)关系链接预测;(2)使用大型视觉语言模型的 RAG 推理。决策模块综合两个路径的证据,以选择最可信的答案。实验结果表明,Hybrid-DMKG 在 MMQAKE 上显著优于现有 MKE 方法,实现更高准确率并提高对知识更新的鲁棒性。

关键词

引用

@article{arxiv.2512.00881,
  title  = {Hybrid-DMKG: A Hybrid Reasoning Framework over Dynamic Multimodal Knowledge Graphs for Multimodal Multihop QA with Knowledge Editing},
  author = {Li Yuan and Qingfei Huang and Bingshan Zhu and Yi Cai and Qingbao Huang and Changmeng Zheng and Zikun Deng and Tao Wang},
  journal= {arXiv preprint arXiv:2512.00881},
  year   = {2025}
}

备注

Accepted by AAAI 2026