迈向可靠的域泛化:一个新数据集与评估
计算机视觉与模式识别
2023-09-13 v1 机器学习
摘要
现实世界中存在普遍的分布偏移。然而,深度神经网络(DNNs)容易偏向训练集,导致在接收分布外数据时性能严重下降。在域泛化(DG)文献中,许多方法被研究用于训练在各种分布偏移下具有泛化能力的模型。然而,近期的 DomainBed 和 WILDS 基准挑战了这些方法的有效性。针对现有研究中的问题,我们提出了一种用于手写汉字识别(HCCR)的新域泛化任务,以丰富 DG 方法研究的应用场景。我们在提出的 PaHCC(印刷体与手写体汉字)数据集上评估了十八种 DG 方法,并表明现有方法在该数据集上的性能仍不尽如人意。此外,在一个设计的动态 DG 设定下,我们揭示了 DG 方法的更多性质,并认为仅留一域出去(leave-one-domain-out)协议是不可靠的。我们主张 DG 领域的研究者参考方法的动态性能,以进行更全面和可靠的评估。我们的数据集与评估为领域带来新视角,以促进更实质性的进展。我们将在文章发表时公开数据集,以方便域泛化的研究。
引用
@article{arxiv.2309.06142,
title = {Towards Reliable Domain Generalization: A New Dataset and Evaluations},
author = {Jiao Zhang and Xu-Yao Zhang and Cheng-Lin Liu},
journal= {arXiv preprint arXiv:2309.06142},
year = {2023}
}