中文

基于非独立同分布数据与分布外样本的灰度学习

机器学习 2023-11-07 v2

摘要

训练数据的完整性,即使由专家标注,也远非得到保证,特别是对于包含分布内和分布外样本的非独立同分布数据集。在理想情况下,大多数样本应为分布内样本,而语义上偏离的样本将被识别为分布外样本并在标注过程中被排除。然而,专家可能错误地将这些分布外样本归类为分布内样本,并为其分配本质上不可靠的标签。这种不可靠标签与多样化数据类型的混合使得学习鲁棒神经网络的任务极具挑战性。我们观察到,除了那些对应于不可靠真实标签的类别外,分布内和分布外样本几乎总是可以被排除属于某些类别。这开启了利用可靠的互补标签(指示样本不属于哪些类别)的可能性。受此洞察的引导,我们引入了一种新颖的方法,称为灰度学习(GL),它同时利用真实标签和互补标签。至关重要的是,GL 基于预测置信度水平自适应地调整这两种标签类型的损失权重。通过将我们的方法建立在统计学习理论之上,我们推导出泛化误差的界限,证明 GL 即使在非独立同分布设置下也能实现紧约束。广泛的实验评估表明,我们的方法显著优于基于稳健统计的替代方法。

关键词

引用

@article{arxiv.2206.09375,
  title  = {Gray Learning from Non-IID Data with Out-of-distribution Samples},
  author = {Zhilin Zhao and Longbing Cao and Chang-Dong Wang},
  journal= {arXiv preprint arXiv:2206.09375},
  year   = {2023}
}