中文

关于未见域泛化的认证与改进

机器学习 2022-06-27 v1

摘要

域泛化(DG)旨在利用来自多个相关源域的数据,学习在测试时遇到的未见域上仍保持高性能的模型。许多现有DG算法在表示空间中减小源分布之间的散度,以潜在地将未见域与源域对齐。其动机是借助到源域的分布距离(如Wasserstein距离)来解释对未见域的泛化分析。然而,由于DG目标的开放性,使用少数基准数据集全面评估DG算法具有挑战性。特别地,我们证明用DG方法训练的模型精度在由流行基准数据集生成的未见域上差异显著。这凸显出DG方法在少数基准数据集上的表现可能不代表其在真实未见域上的表现。为克服这一障碍,我们提出了一种基于分布鲁棒优化(DRO)的通用认证框架,可高效认证任意DG方法的最坏情况性能。这使得对DG方法的数据无关评估能够补充基准数据集上的经验评估。此外,我们提出了一种可与任意DG方法配合使用的训练算法,可证明地改进其认证性能。我们的经验评估证明了该方法在显著改善最坏情况损失(即降低这些模型在真实环境中失效的风险)的同时,不会在基准数据集上造成显著性能下降的有效性。

关键词

引用

@article{arxiv.2206.12364,
  title  = {On Certifying and Improving Generalization to Unseen Domains},
  author = {Akshay Mehra and Bhavya Kailkhura and Pin-Yu Chen and Jihun Hamm},
  journal= {arXiv preprint arXiv:2206.12364},
  year   = {2022}
}