中文

超越视觉:基于多模态检索的上下文丰富图像描述

计算机视觉与模式识别 2026-02-03 v2 人工智能

摘要

现实世界的图像描述往往缺乏上下文深度,忽略了诸如事件背景、时间线索、结果以及不可视见的专有名词等关键细节。这一差距限制了在新闻、教育和数字档案等领域实现图像理解的效果,而这些场景都需要更丰富、更具信息性的描述。为此,我们提出了一种多模态管道,通过外部文本知识来丰富视觉输入。我们的系统使用BEIT-3(Flickr30k-384和COCO-384)和SigLIP So-384检索语义相似的图像,通过ORB和SIFT进行几何对齐,并通过语义搜索从相关文章中提取上下文信息。随后,一个经过QLoRA微调的Qwen3模型将此上下文与由Instruct BLIP(Vicuna-7B)生成的基础描述整合,以产生事件丰富、上下文感知的描述。在OpenEvents v1数据集上评估,我们的方法生成的描述显著比传统方法更具信息性,显示出在需要更深层次视觉-文本理解的实际应用中具有强大的潜力。

关键词

引用

@article{arxiv.2512.20042,
  title  = {Beyond Vision: Contextually Enriched Image Captioning with Multi-Modal Retrieval},
  author = {Nguyen Lam Phu Quy and Pham Phu Hoa and Tran Chi Nguyen and Dao Sy Duy Minh and Nguyen Hoang Minh Ngoc and Huynh Trung Kiet},
  journal= {arXiv preprint arXiv:2512.20042},
  year   = {2026}
}

备注

7 pages, 5 figures. System description for the EVENTA Grand Challenge (Track 1) at ACM MM'25