探索图像描述中多样化的上下文学习配置
计算机视觉与模式识别
2024-01-24 v6
摘要
在发现语言模型(LMs)可以成为优秀的上下文少样本学习器之后,人们提出了众多策略来优化上下文序列配置。近来,视觉-语言(VL)领域的研究者也开发了自己的少样本学习器,但他们仅使用了最简单的方式,即随机采样,来配置上下文图像-文本对。为了探究不同配置对 VL 上下文学习的影响,我们设计了四种图像选择策略和四种描述分配策略,以配置用于图像描述的上下文图像-文本对。此处以图像描述作为案例研究,因为其可视为视觉条件下的语言模型。我们全面的实验得出了两个反直觉但有价值的见解,凸显了由于多模态协同作用,VL 上下文学习相较于 NLP 案例所具有的独特特性。此外,在我们对最优组合策略的探索中,观察到相较于基线,CIDEr 分数平均提升了 20.9。代码见 https://github.com/yongliang-wu/ExploreCfg。
引用
@article{arxiv.2305.14800,
title = {Exploring Diverse In-Context Configurations for Image Captioning},
author = {Xu Yang and Yongliang Wu and Mingzhuo Yang and Haokun Chen and Xin Geng},
journal= {arXiv preprint arXiv:2305.14800},
year = {2024}
}
备注
Accepted by NeurIPS2023