StarFT:通过 Spuriosity Alignment 实现零样模型的稳健微调
人工智能
2025-06-30 v3 计算机视觉与模式识别
摘要
从数据中学习稳健的表示通常需要规模,这导致了最近零样模型如 CLIP 的成功。然而,这些模型获得的鲁棒性在对这些模型进行微调其他下游任务(例如规模较小的任务)时容易受到损害。以往的研究常在域迁移的背景下解释这一现象,发展出旨在尽可能保留原始域的微调方法。然而,在不同情境下,规模有限的微调模型也容易学习对人类而言是虚假的特征,例如背景或纹理。在本文中,我们提出了 StarFT (Spurious Textual Alignment Regularization),一个用于增强微调零信模型鲁棒性的新框架,通过防止模型学习虚假性来实现。我们引入一种正则化,将虚假注入标签的输出分布与原始零信模型对齐,以确保模型不会从这些描述中进一步提取不相关特征。我们利用最近的语言模型获取虚假注入标签,通过生成强调可能混淆特征的替代文本描述来实现。大量实验验证了 StarFT 的稳健泛化以及其显现的属性:零信 group 鲁棒性和改进的零信分类。值得注意的是,在 Waterbirds group 迁移情境中,StarFT 将最坏组和平均准确率分别提高了 14.30% 和 3.02%,而其他鲁棒微调基线甚至显示出性能下降。
引用
@article{arxiv.2505.13232,
title = {StarFT: Robust Fine-tuning of Zero-shot Models via Spuriosity Alignment},
author = {Younghyun Kim and Jongheon Jeong and Sangkyung Kwak and Kyungmin Lee and Juho Lee and Jinwoo Shin},
journal= {arXiv preprint arXiv:2505.13232},
year = {2025}
}
备注
IJCAI 2025; Code is available at https://github.com/alinlab/StarFT