迈向更好的域外泛化评估
机器学习
2024-06-04 v2 计算机视觉与模式识别
机器学习
摘要
域泛化(DG)的目标是设计算法和模型,使其能够在未见过的测试分布上实现高性能。为了实现这一目标,现有DG研究中普遍采用平均度量作为评估模型和比较算法的指标。尽管平均度量很重要,但对其全面探索尚显不足,且其在近似真实域泛化性能方面的适用性存疑。在本研究中,我们仔细研究了平均度量固有的局限性,并提出最差+差距度量作为稳健的替代方案。我们从两个不同的假设出发,推导出两个定理,为所提出的度量建立了理论基础。我们进行了广泛的实验研究,将所提出的最差+差距度量与传统平均度量进行比较。由于研究度量需要访问真实的DG性能,我们修改了五个现有数据集,生成了SR-CMNIST、C-Cats&Dogs、L-CIFAR10、PACS-corrupted和VLCS-corrupted数据集。实验结果表明,平均度量在近似真实DG性能方面表现不佳,并证实了有理论支持的最差+差距度量的稳健性。
引用
@article{arxiv.2405.19703,
title = {Towards a Better Evaluation of Out-of-Domain Generalization},
author = {Duhun Hwang and Suhyun Kang and Moonjung Eo and Jimyeong Kim and Wonjong Rhee},
journal= {arXiv preprint arXiv:2405.19703},
year = {2024}
}