中文

TPCap: 通过触发增强与多模态净化模块解锁零样本图像描述生成

计算机视觉与模式识别 2025-02-18 v1

摘要

近期,大语言模型(LLM)的进展显著提升了图像描述生成的流畅性和逻辑连贯性。检索增强生成(RAG)被广泛采用以将外部知识融入 LLM;然而,现有的基于 RAG 的方法依赖于独立的检索库,引入计算开销并限制了 LLM 固有零样本能力的利用。为解决这些局限性,我们提出 TPCap,一种用于零样本图像描述生成的新型触发增强与多模态净化框架,无需外部检索库。TPCap 由两个关键组件组成:触发增强(TA)生成与多模态净化(MP)。TA 模块采用触发投影器,结合冻结投影与可学习投影,以激活 LLM 的上下文推理能力、增强视觉-文本对齐并缓解数据偏差。MP 模块进一步通过过滤噪声和增强特征质量来精炼生成的实体相关信息,确保更精确且事实一致的描述。我们在 COCO、NoCaps、Flickr30k 和 WHOOPS 数据集上评估 TPCap。仅使用 0.82M 可训练参数并在单块 NVIDIA RTX 4090 GPU 上训练,TPCap 达到了与最先进模型相当的竞争性性能。

关键词

引用

@article{arxiv.2502.11024,
  title  = {TPCap: Unlocking Zero-Shot Image Captioning with Trigger-Augmented and Multi-Modal Purification Modules},
  author = {Ruoyu Zhang and Lulu Wang and Yi He and Tongling Pan and Zhengtao Yu and Yingna Li},
  journal= {arXiv preprint arXiv:2502.11024},
  year   = {2025}
}