通过神经崩溃视角理解视觉-语言模型的提示微调
计算机视觉与模式识别
2023-09-08 v3
摘要
大规模视觉-语言(V-L)模型通过提示微调(prompt tuning)展现出了对下游任务的卓越泛化能力。然而,所学文本表征背后的机制尚不清楚,限制了进一步的泛化提升,尤其在类不平衡场景下。视觉仅模型中神经崩溃(NC)现象的近期进展表明,最优表征结构为单纯形 ETF,这为研究 V-L 模型中的表征铺平了道路。本文首次尝试利用 NC 通过提示微调考察 V-L 模型中的表征。发现文本到图像表征的 NC 最优性与下游泛化能力呈正相关,在类不平衡设定下此现象更为严重。为改进表征,我们提出神经崩溃锚定提示微调(NPT),一种学习满足相同单纯形 ETF 的文本与图像表征提示的新方法。NPT 引入两个正则项:语言模态崩溃与多模态同构;并且它与其他提示微调方法兼容。大量实验表明,NPT 能在 11 个数据集上持续帮助改进现有提示微调技术,适用于平衡与不平衡设定。
引用
@article{arxiv.2306.15955,
title = {Understanding Prompt Tuning for V-L Models Through the Lens of Neural Collapse},
author = {Didi Zhu and Zexi Li and Min Zhang and Junkun Yuan and Yunfeng Shao and Jiashuo Liu and Kun Kuang and Yinchuan Li and Chao Wu},
journal= {arXiv preprint arXiv:2306.15955},
year = {2023}
}