基于思维链子空间元学习的少样本图像描述生成方法:结合大型视觉与语言模型
计算机视觉与模式识别
2025-02-20 v1
摘要
在海量数据上预训练的大型视觉与语言模型编码了视觉与语言先验,使得生成更自然、更逼真的图像和语言变得更容易。尽管如此,视觉与语言模态之间仍然存在显著的领域鸿沟,特别是在少样本设置下训练数据稀缺、仅有极有限数据可用于训练时。为了缓解这一问题,已有研究提出一种多模态元学习框架,通过引入连接两个冻结预训练大型视觉与语言模型的可调提示来弥合它们之间的鸿沟。对于少样本图像描述生成,现有的多模态元学习框架采用单步提示方案来累积输入图像的视觉特征以引导语言模型,但在仅有少量训练样本时难以生成准确的图像描述。相反,我们提出一种思维链元学习方案,将其作为多步图像描述生成过程,以更好地模仿人类描述图像的方式。此外,我们进一步提出在不同的子空间中学习对应每个 CoT 步骤的模型元参数,以避免干扰。我们在少样本设置下于三个常用图像描述数据集(即 MSCOCO、Flickr8k 和 Flickr30k)上评估了我们的方法。实验结果表明,以不同指标在不同数据集上衡量,我们的思维链子空间元学习策略在性能上均优于基线。
引用
@article{arxiv.2502.13942,
title = {A Chain-of-Thought Subspace Meta-Learning for Few-shot Image Captioning with Large Vision and Language Models},
author = {Hao Huang and Shuaihang Yuan and Yu Hao and Congcong Wen and Yi Fang},
journal= {arXiv preprint arXiv:2502.13942},
year = {2025}
}
备注
11 pages, 3 figures, 5 tables