Connect Later:通过定向增强改进微调以实现鲁棒性
计算机视觉与模式识别
2024-06-24 v2 机器学习
摘要
在有标签的源域(例如,来自野生动物相机陷阱的已标记图像)上训练的模型,在部署到分布外(OOD)目标域(例如,来自新相机陷阱位置的图像)时,通常泛化能力很差。在无标签目标数据可用的域适应设置中,自监督预训练(例如,掩码自编码或对比学习)是一种有前景的方法来缓解这种性能下降。当使用的通用数据增强(例如,掩码或裁剪)连接了在输入空间中可能相距甚远的源域和目标域时,预训练可以改善OOD误差。在本文中,我们在现实世界任务中表明,预训练后的标准微调并不总能比仅在带标签的源数据上从头开始训练更稳定地改善OOD误差。为了更好地利用预训练应对分布偏移,我们提出了Connect Later:在使用通用增强进行预训练后,使用根据分布偏移知识设计的定向增强进行微调。预训练在源域和目标域内学习良好的表示,而定向增强在微调期间更好地连接这些域。在4个真实世界数据集上,Connect Later相比标准微调和使用定向增强的监督学习,改善了平均OOD误差:Connect Later在天文时间序列分类(AstroClassification)上以2.5%的优势达到最先进水平,在使用ResNet-50的野生动物物种识别(iWildCam-WILDS)上以0.9%的优势达到最先进水平,在使用DenseNet121的肿瘤识别(Camelyon17-WILDS)上以1.1%的优势达到最先进水平;并在一个新的天文时间序列红移预测数据集(Redshifts)上以0.03 RMSE(相对提升11%)取得了最佳性能。代码和数据集可在https://github.com/helenqu/connect-later获取。
引用
@article{arxiv.2402.03325,
title = {Connect Later: Improving Fine-tuning for Robustness with Targeted Augmentations},
author = {Helen Qu and Sang Michael Xie},
journal= {arXiv preprint arXiv:2402.03325},
year = {2024}
}
备注
ICML 2024