从特征失真与简洁性偏置视角重新审视模型自适应
机器学习
2023-03-24 v1
摘要
预训练模型表达能力的提升,增加了人们对设计能够安全有效迁移学习的自适应协议的兴趣。超越传统的线性探测(LP)和微调(FT)策略,能够有效控制特征失真的协议(即未能更新与分布内正交的特征的失败情况)已被发现可改善分布外泛化(OOD)。为限制这种失真,提出了 LP+FT 协议,即先学习线性探针再将其作为后续 FT 的初始化。然而,本文中我们发现,当在多种安全性目标(如校准、鲁棒性等)上评估自适应协议(LP、FT、LP+FT)时,特征失真之外的互补视角有助于解释协议行为。为此,我们研究了协议对简洁性偏置(SB,即深度神经网络依赖简单特征的已知倾向)的敏感性,因为最近研究表明 SB 是鲁棒泛化中若干问题的根源。利用合成数据集,我们展示了现有协议对 SB 的敏感性。鉴于 LP+FT 的强有效性,我们进而提出改进的线性探针以缓解 SB,并为后续 FT 提供更好的初始化。我们在受控设定下验证了所提 LP+FT 变体降低 SB 的有效性,以及它们在三个自适应数据集上改善 OOD 泛化和安全性的能力。
引用
@article{arxiv.2303.13500,
title = {A Closer Look at Model Adaptation using Feature Distortion and Simplicity Bias},
author = {Puja Trivedi and Danai Koutra and Jayaraman J. Thiagarajan},
journal= {arXiv preprint arXiv:2303.13500},
year = {2023}
}
备注
Accepted to ICLR 2023 as notable-25% (spotlight)