论特征可分离性在预测分布外误差中的重要性
机器学习
2023-10-24 v2
摘要
在没有真实标签的情况下,估计模型在分布外(OOD)数据上的泛化性能在实践中具有挑战性。先前的方法强调分布差异与OOD准确率之间的联系,而我们表明较大的域间隙未必导致较低的测试准确率。本文从特征可分离性的角度,通过经验与理论对该问题进行了研究。具体而言,我们提出一种基于特征离散度的数据集级分数,用以估计分布偏移下的测试准确率。我们的方法受表示学习中特征理想特性的启发:高类间离散度与高类内紧致度。我们的分析表明,类间离散度与模型准确率强相关,而类内紧致度并不反映OOD数据上的泛化性能。大量实验证明了我们的方法在预测性能与计算效率上的优越性。
引用
@article{arxiv.2303.15488,
title = {On the Importance of Feature Separability in Predicting Out-Of-Distribution Error},
author = {Renchunzi Xie and Hongxin Wei and Lei Feng and Yuzhou Cao and Bo An},
journal= {arXiv preprint arXiv:2303.15488},
year = {2023}
}