ReCap:基于文章检索与语义高斯归一化的事件感知图像描述
计算机视觉与模式识别
2025-09-03 v1
摘要
图像描述系统通常生成通用描述,无法捕捉对新闻报道和数字存档等应用至关重要的事件级语义。我们提出 ReCap,一种用于事件丰富图像检索与描述的新型流程,该流程整合来自相关文章的更广泛上下文信息,以生成叙事丰富、事实依据充分的描述。我们的方法解决了标准视觉-语言模型的局限性,这些模型通常只关注可见内容,而忽略了时间、社会和历史背景。ReCap 包含三个集成组件:(1)一个鲁棒的两阶段文章检索系统,使用 DINOv2 嵌入进行全局特征相似度初始候选选择,随后进行块级互最近邻相似度重排序;(2)一个上下文提取框架,综合来自文章摘要、通用描述和原始源元数据的信息;(3)一个基于大语言模型的描述生成系统,采用语义高斯归一化以增强流畅性和相关性。在作为 EVENTA 2025 大挑战赛道 1 一部分的 OpenEvents V1 数据集上评估,ReCap 取得了 0.54666 的强劲总分,在私有测试集上排名第二。这些结果突显了 ReCap 在连接视觉感知与现实世界知识方面的有效性,为高风险领域中的上下文感知图像理解提供了实用解决方案。代码可在 https://github.com/Noridom1/EVENTA2025-Event-Enriched-Image-Captioning 获取。
引用
@article{arxiv.2509.01259,
title = {ReCap: Event-Aware Image Captioning with Article Retrieval and Semantic Gaussian Normalization},
author = {Thinh-Phuc Nguyen and Thanh-Hai Nguyen and Gia-Huy Dinh and Lam-Huy Nguyen and Minh-Triet Tran and Trung-Nghia Le},
journal= {arXiv preprint arXiv:2509.01259},
year = {2025}
}
备注
ACM Multimedia 2025