视觉对齐语言:面向增强 LLMs 推理的无标注多模态知识图谱构建
计算机视觉与模式识别
2025-11-24 v3 人工智能
摘要
大型语言模型 (LLMs) 中的多模态推理面临着知识不完整和幻觉伪影的挑战,而文本知识图谱 (KGs) 由于其模态隔离,仅能部分缓解这些挑战。尽管多模态知识图谱 (MMKGs) 有望增强跨模态理解,但其实际构建受到手动文本标注的语义狭隘性以及视觉-语义实体链接中固有噪声的阻碍。在本文中,我们提出了视觉对齐语言集成知识图谱 (VaLiK),这是一种构建 MMKGs 的新方法,通过跨模态信息补充来增强 LLMs 推理。具体而言,我们级联预训练的视觉-语言模型 (VLMs) 将图像特征与文本对齐,将其转化为包含图像特定信息的描述。此外,我们开发了一种跨模态相似性验证机制来量化语义一致性,有效过滤特征对齐过程中引入的噪声。即使没有手动标注的图像说明,仅凭精炼后的描述也足以构建 MMKG。与传统的 MMKGs 构建范式相比,我们的方法在保持直接实体到图像链接能力的同时,实现了显著的存储效率提升。在多模态推理任务上的实验结果表明,使用 VaLiK 增强的 LLMs 优于之前的最先进模型。我们的代码已发布于 https://github.com/Wings-Of-Disaster/VaLiK。
引用
@article{arxiv.2503.12972,
title = {Aligning Vision to Language: Annotation-Free Multimodal Knowledge Graph Construction for Enhanced LLMs Reasoning},
author = {Junming Liu and Siyuan Meng and Yanting Gao and Song Mao and Pinlong Cai and Guohang Yan and Yirong Chen and Zilin Bian and Ding Wang and Botian Shi},
journal= {arXiv preprint arXiv:2503.12972},
year = {2025}
}
备注
14 pages, 7 figures, 6 tables; Accepted by ICCV 2025