中文

EchoAlign:在噪声标签下桥接生成式与判别式学习

机器学习 2026-05-12 v3

摘要

噪声标签严重阻碍了机器学习模型的准确性和泛化能力,尤其是当模糊的实例特征使得可靠标注变得困难时。现有方法(包括基于转移矩阵的标签纠正)难以捕捉实例与噪声标签之间的复杂关系,限制了其在这些场景下的有效性。我们提出了 EchoAlign,一个在噪声标签下桥接生成式与判别式学习的框架。EchoAlign 不纠正标签,而是将噪声标签作为监督目标,并修改相应的实例以使其与标签对齐。该框架包含两个组件:EchoMod 使用可控生成模型调整实例特征,同时保留关键的实例级结构线索(如形状和边缘),并避免过度扭曲;EchoSelect 在原始样本与修改后样本之间特征相似度的引导下,保留原始实例的可靠子集,以缓解分布偏移。这种生成式与判别式的交互使得在高度噪声环境下也能进行稳健学习。在三个基准数据集上的实验表明,EchoAlign 在大多数评估设置中优于 SOTA 方法。在 30% 的实例相关噪声下,EchoSelect 保留的正确标记样本数量几乎是竞争方法的两倍,同时保持了 99% 的选择准确率,证明了 EchoAlign 的稳健性和有效性。

关键词

引用

@article{arxiv.2405.12969,
  title  = {EchoAlign: Bridging Generative and Discriminative Learning under Noisy Labels},
  author = {Yuxiang Zheng and Zhongyi Han and Yilong Yin},
  journal= {arXiv preprint arXiv:2405.12969},
  year   = {2026}
}

备注

27 pages, 7 figures. The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: 10.1007/s11704-026-51604-z