面向资源受限设备的量化提示提升视觉语言模型的高效泛化
计算机视觉与模式识别
2024-07-23 v2
摘要
过去几年里,像 CLIP 这样的大规模预训练视觉语言模型在诸多领域取得巨大成功。自然地,如何将这些庞大预训练模型中的丰富知识迁移到下游任务和数据集成为热门话题。在下游适应期间,最具挑战性的问题是过拟合和灾难性遗忘,这会导致模型过度关注当前数据而丢失更关键的领域通用知识。现有工作使用经典正则化技术来解决这些问题。随着解决方案日益复杂,存储和推理成本也成为迫在眉下的重要问题。本文我们基于一个观察:适当的随机噪声可抑制过拟合和灾难性遗忘。我们将量化误差视为一种噪声,探索基于量化的视觉语言模型正则化,这既高效又有效。进一步地,为了在最小成本下提高模型的泛化能力同时保持其专门化能力,我们深入分析了提示权重分布的特征,得出若干量化模块设计原则,并遵循这些原则构建多个具竞争力的基线。该方法因其内在轻量级特性而显著高效,使得在极端资源受限的设备上也能进行适应。我们的方法可有效集成到诸多现有方法中,如 MaPLe,既提升准确率又降低存储开销,因而更强大且更灵活。广泛的实验表明,我们的方法在 11 个数据集上均表现出色。代码已公开于 https://github.com/beyondhtx/QPrompt。
引用
@article{arxiv.2407.10704,
title = {Quantized Prompt for Efficient Generalization of Vision-Language Models},
author = {Tianxiang Hao and Xiaohan Ding and Juexiao Feng and Yuhong Yang and Hui Chen and Guiguang Ding},
journal= {arXiv preprint arXiv:2407.10704},
year = {2024}
}
备注
ECCV 2024