中文

迈向高效的视觉-语言微调:更高的信息密度,更强的泛化能力

计算机视觉与模式识别 2024-09-12 v3 计算与语言 机器学习

摘要

随着大型预训练视觉-语言模型的发展,有效地将这些基础模型中嵌入的知识转移到下游任务已成为一个关键课题,特别是在数据稀缺的环境中。最近,参数高效微调方法,尤其是提示微调,引起了广泛关注。为了更好地理解提示微调的本质,我们提出了“信息密度”(ID)的概念,用以指示一个矩阵是否强烈属于某些特征空间,而不是均匀分布在各种特征空间中。我们认为,具有跨某些特征空间强偏置的更高 ID 自然会带来出色的鲁棒性和稳定性。我们的研究受到泛化能力与提示矩阵的信息密度密切相关的观察启发,引入了密集信息提示(DIP)。DIP 旨在通过增强信息密度来提高泛化能力。此外,DIP 显著减少了可调参数的数量和所需的存储空间,使其在资源受限的环境中特别具有优势。综合实验证实了 DIP 的优越性。值得注意的是,DIP 以极小的参数量大幅超越了最新 SOTA 方法。在跨越 11 个数据集的一系列任务中,DIP 仅使用 0.5K 参数就将经典提示微调的平均下游准确率提高了 5.76%。

关键词

引用

@article{arxiv.2312.10813,
  title  = {Towards Efficient Vision-Language Tuning: More Information Density, More Generalizability},
  author = {Tianxiang Hao and Mengyao Lyu and Hui Chen and Sicheng Zhao and Xiaohan Ding and Jungong Han and Guiguang Ding},
  journal= {arXiv preprint arXiv:2312.10813},
  year   = {2024}
}