中文

DualCap:通过类似场景视觉提示增强轻量级图像描述

计算机视觉与模式识别 2025-10-30 v1 人工智能

摘要

最近的轻量级检索增强图像描述模型通常仅将检索数据用作文本提示,导致原始视觉特征未被增强,尤其体现为对物体细节或复杂场景的不足。为解决此限制,我们提出了 DualCapDualCap,一种通过生成来自检索相似图像的视觉提示来丰富视觉表征的新方法。我们的模型采用双检索机制,使用标准图像到文本检索获取文本提示,同时采用新颖的图像到图像检索获取视觉类似场景。具体而言,从视觉相似场景的描述中提取显著关键词和短语,以捕获关键物体和相似细节。这些文本特征随后通过轻量级可训练特征融合网络编码并与原始图像特征集成。广泛的实验表明,该方法在较少可训练参数下实现了与先前视觉提示描述方法相当的性能。

关键词

引用

@article{arxiv.2510.24813,
  title  = {DualCap: Enhancing Lightweight Image Captioning via Dual Retrieval with Similar Scenes Visual Prompts},
  author = {Binbin Li and Guimiao Yang and Zisen Qi and Haiping Wang and Yu Ding},
  journal= {arXiv preprint arXiv:2510.24813},
  year   = {2025}
}