统一视觉语言潜在表示用于零标签图像字幕增强
计算机视觉与模式识别
2025-10-16 v1 计算与语言
摘要
视觉语言模型(VLMs)通过大规模图像-文本预训练实现了卓越的性能。然而,它们依赖标记的图像数据集,这限制了可扩展性,并未充分利用大量未标记图像数据的潜力。为此,我们提出了统一视觉语言对齐用于零标签增强(ViZer),一种使图像字幕零标签学习的增强训练框架,为视觉语言任务的更广泛零标签适应提供了实用出发点。不同于依赖人类或合成标记数据集的先前方法,ViZer 在训练期间主动对齐视觉和语言表示特征,使现有 VLMs 能够在不需文本标签或完全重新训练的情况下生成改进的字幕。我们在定性评估中展示了 ViZer 的优势,因为自动字幕指标如 CIDEr 和 BERTScore 常对缺乏参考字幕中缺失的细节进行惩罚。将 ViZer 应用于 SmolVLM-Base 和 Qwen2-VL,我们观察到一致的定性改进,生成的字幕在基线字幕相比更具 grounding 能力和描述性。
引用
@article{arxiv.2510.12931,
title = {Unifying Vision-Language Latents for Zero-label Image Caption Enhancement},
author = {Sanghyun Byun and Jung Ick Guack and Mohanad Odema and Baisub Lee and Jacob Song and Woo Seong Chung},
journal= {arXiv preprint arXiv:2510.12931},
year = {2025}
}
备注
Accepted to PMLR and NeurIPS 2025 UniReps