知识补全视觉:一种用于新闻图像描述的多模态实体感知检索增强生成框架
计算机视觉与模式识别
2025-11-27 v1 人工智能
摘要
新闻图像描述旨在通过结合视觉内容与相关文章的上下文线索,生成具有新闻信息量的描述。尽管近期取得了进展,现有方法仍面临三个关键挑战:(1)信息覆盖不完整,(2)跨模态对齐薄弱,以及(3)视觉-实体关联次优。为了解决这些问题,我们提出了MERGE,这是首个用于新闻图像描述的多模态实体感知检索增强生成框架。MERGE构建了一个以实体为中心的多模态知识库(EMKB),该知识库整合了文本、视觉和结构化知识,从而实现丰富的背景检索。它通过多阶段假设-描述策略改善跨模态对齐,并通过由图像内容引导的动态检索增强视觉-实体匹配。在GoodNews和NYTimes800k数据集上的大量实验表明,MERGE显著优于最先进的基线模型,在描述质量上CIDEr得分分别提升了+6.84和+1.16,在命名实体识别上F1分数分别提升了+4.14和+2.64。值得注意的是,MERGE还能很好地泛化到未见过的Visual News数据集,CIDEr得分提升+20.17,F1分数提升+6.22,展示了强大的鲁棒性和领域适应性。
引用
@article{arxiv.2511.21002,
title = {Knowledge Completes the Vision: A Multimodal Entity-aware Retrieval-Augmented Generation Framework for News Image Captioning},
author = {Xiaoxing You and Qiang Huang and Lingyu Li and Chi Zhang and Xiaopeng Liu and Min Zhang and Jun Yu},
journal= {arXiv preprint arXiv:2511.21002},
year = {2025}
}
备注
Accepted to AAAI 2026