面向低资源序列标注自训练数据的噪声标签处理
计算与语言
2019-04-03 v1 机器学习
摘要
在本文中,我们探讨了在低资源场景下有效进行神经网络自训练的问题。自训练常被用于自动增加训练数据量。然而,在低资源场景下,由于对未标注数据进行自标注生成的标注不可靠,其效果欠佳。我们提议将自训练与对自标注数据的噪声处理相结合。直接在合并的干净训练集与自标注数据上估计噪声会导致干净数据被破坏,从而导致性能下降。因此,我们提出干净与噪声标签神经网络,通过分别显式建模干净标签与噪声标签,在干净数据与带噪自标注数据上同时进行训练。在 Chunking 和 NER 上的实验中,该方法比基线表现出更强的鲁棒性。作为此显式方法的补充,噪声也可借助辅助学习任务被隐式处理。对于此类互补方法,我们的方法比其他基线方法更有利,二者结合总体上提供了最佳性能。
引用
@article{arxiv.1903.12008,
title = {Handling Noisy Labels for Robustly Learning from Self-Training Data for Low-Resource Sequence Labeling},
author = {Debjit Paul and Mittul Singh and Michael A. Hedderich and Dietrich Klakow},
journal= {arXiv preprint arXiv:1903.12008},
year = {2019}
}