基于检索增强与模态差异纠正的图像描述文本-only 训练方法
计算机视觉与模式识别
2025-12-05 v1 计算与语言
摘要
图像描述吸引了自然语言处理和计算机视觉领域的广泛关注。旨在减少对精选数据的依赖,several 研究探索了在没有人类标注的图像-文本对的情况下进行图像描述,尽管现有方法仍被完全监督的方法所超越。本文提出了 TOMCap,即一种改进的文本-only 训练方法,可在不需要对齐的图像-描述对的情况下进行描述。该方法基于在 CLIP 表示信息驱动下,对预训练语言模型解码器进行提示,经过以减少模态差异为目标的过程。我们特别测试了结合使用描述检索示例和潜在向量表示来指导生成过程的组合。通过大量实验,我们表明 TOMCap 在其他训练-free 和文本-only 方法中表现更佳。我们还分析了关于检索增强和模态差异减少组件不同配置选择的影响。
关键词
引用
@article{arxiv.2512.04309,
title = {Text-Only Training for Image Captioning with Retrieval Augmentation and Modality Gap Correction},
author = {Rui Fonseca and Bruno Martins and Gil Rocha},
journal= {arXiv preprint arXiv:2512.04309},
year = {2025}
}
备注
Submitted to CVPR 2026