中文

机器学习模型的离群点鲁棒训练

机器学习 2025-01-03 v1 计算机视觉与模式识别

摘要

在离群点存在的情况下对机器学习模型进行鲁棒训练已在多个领域引起关注。使用鲁棒损失函数是一种流行的方法,已知可减轻离群点的影响。我们揭示了两条在设计鲁棒损失方面已分化的研究路线:一条使用 M 估计,在机器人学与计算机视觉中流行;另一条使用风险最小化框架,在深度学习中流行。我们首先证明对 Black-Rangarajan 对偶性的一个简单修改可提供统一的视角。修改后的对偶性揭示了一个鲁棒损失核 σ\sigma 的定义,该定义被两条研究路线中的鲁棒损失所满足。其次,利用修改后的对偶性,我们提出了一种用于在离群点下训练机器学习模型的自适应交替算法(AAA)。该算法通过使用非鲁棒损失的加权版本来迭代训练模型,同时在每次迭代中更新权重。该算法通过将权重解释为内点概率,采用了一种新颖的参数更新规则,从而无需复杂的参数调优。第三,我们研究了自适应交替算法收敛到无离群点最优解的性质。考虑任意离群点(即对离群点不作分布假设),我们证明使用鲁棒损失核 σ\sigma 会扩大收敛区域。我们在回归、分类和神经场景重建问题上实验性地展示了我们算法的有效性。我们发布了实现代码:https://github.com/MIT-SPARK/ORT。

关键词

引用

@article{arxiv.2501.00265,
  title  = {Outlier-Robust Training of Machine Learning Models},
  author = {Rajat Talak and Charis Georgiou and Jingnan Shi and Luca Carlone},
  journal= {arXiv preprint arXiv:2501.00265},
  year   = {2025}
}