中文

面向图像描述的检索式对象与关系提示 RORPCap

计算机视觉与模式识别 2025-08-12 v1

摘要

图像描述旨在以开放形式生成与输入图像相关的自然语言描述。为了准确生成与图像相关的描述,关键步骤是识别图像中的对象并理解它们之间的关系。现代方法通常依赖对象检测器或将检测器与图卷积网络(GCN)结合。然而,这些模型存在检测信息冗余、GCN 构建困难以及高训练成本等问题。为此,提出受图像-文本检索可为输入图像提供丰富语义信息的启发,提出一种检索式对象与关系提示用于图像描述(RORPCap)。RORPCap 采用对象与关系提取模型从图像中提取对象和关系词汇。这些词汇被整合到预定义的提示模板中并编码为提示嵌入。随后,设计了一个基于 Mamba 的映射网络,用于快速将由 CLIP 提取的图像嵌入映射到视觉-文本嵌入。最后,将所得提示嵌入与视觉-文本嵌入拼接,以形成文本丰富化特征嵌入,输入到 GPT-2 模型进行描述生成。在广泛使用的 MS-COCO 数据集上进行的大量实验表明,RORPCap 在交叉熵损失下训练仅需 2.6 小时,在“Karpathy”测试分割上实现 120.5% 的 CIDEr 分数和 22.0% 的 SPICE 分数。RORPCap 在检测器-based 和 GCN-based 模型中实现了相当的性能指标,同时训练时间最短,展示了其作为图像描述备选方案的潜力。

关键词

引用

@article{arxiv.2508.07318,
  title  = {RORPCap: Retrieval-based Objects and Relations Prompt for Image Captioning},
  author = {Jinjing Gu and Tianbao Qin and Yuanyuan Pu and Zhengpeng Zhao},
  journal= {arXiv preprint arXiv:2508.07318},
  year   = {2025}
}