中文

不变风险最小化的分布外最优性

机器学习 2024-10-30 v2 机器学习

摘要

深度神经网络常常继承训练数据中嵌入的虚假相关性,因此可能无法泛化到与提供训练数据的域具有不同分布的未见域。M. Arjovsky 等人(2019)引入了分布外(o.o.d.)风险的概念,即所有域上的最大风险,并将虚假相关性引起的问题表述为 o.o.d. 风险的最小化问题。不变风险最小化(Invariant Risk Minimization, IRM)被认为是一种有前景的最小化 o.o.d. 风险的方法:IRM 通过求解一个双层优化问题来估计 o.o.d. 风险的最小值。尽管 IRM 因经验上的成功而备受关注,但其理论保证很少。特别是,双层优化问题给出 o.o.d. 风险最小值这一坚实的理论保证尚未建立。旨在为 IRM 提供理论依据,本文严格证明了在某些条件下,双层优化问题的解使 o.o.d. 风险最小化。该结果还提供了关于提供训练数据的分布以及特征空间维度使该双层优化问题最小化 o.o.d. 风险的充分条件。

关键词

引用

@article{arxiv.2307.11972,
  title  = {Out-of-Distribution Optimality of Invariant Risk Minimization},
  author = {Shoji Toyota and Kenji Fukumizu},
  journal= {arXiv preprint arXiv:2307.11972},
  year   = {2024}
}