中文

使用合成标题进行多模态微调

计算机视觉与模式识别 2026-01-30 v1

摘要

本文解决了一个深入神经网络预训练与微调之间的根本性鸿沟:尽管预训练已从单模态转向多模态学习以增强视觉理解,但微调主要仍停留在单模态范畴,限制了丰富预训练表征的潜在益处。为弥合这一鸿沟,我们提出了一种新方法,通过多模态大型语言模型(MLLMs)生成合成图像标题,将单模态数据集转换为多模态数据集,以进行多模态目标的微调。我们采用精心设计的提示词,融合类别标签和领域上下文,以生成针对分类任务优化的高质量标题。此外,我们引入一种监督对比损失函数,显式鼓励同一类别表征在微调期间的聚类,并提出一种新的推理技术,利用每个图像的多个合成标题中类别平均文本嵌入。广泛的实验在 13 个图像分类基准测试上表明,我们的方法优于基线方法,尤其在少样本学习场景中取得显著性提升。我们的工作建立了一种新范式,用于数据增强,有效弥合了多模态预训练与微调之间的差距。我们的代码可在 https://github.com/s-enmt/MMFT 查阅。

关键词

引用

@article{arxiv.2601.21426,
  title  = {MultiModal Fine-tuning with Synthetic Captions},
  author = {Shohei Enomoto and Shin'ya Yamaguchi},
  journal= {arXiv preprint arXiv:2601.21426},
  year   = {2026}
}