需规避的话题:在文本分类中抑制潜在混杂因子
机器学习
2021-06-16 v2 计算与语言
机器学习
摘要
尽管深度神经网络在许多文本分类任务上表现优异,但它们倾向于学习训练数据特有的、频繁出现的表面模式,而这些模式并不总是能很好地泛化。在这项工作中,我们针对母语识别任务观察到了这一局限。我们发现,在测试集上表现良好的标准文本分类器最终学习了作为预测任务混杂因子的主题特征(例如,如果输入文本提到瑞典,分类器就预测作者的母语是瑞典语)。我们提出了一种表示潜在主题混杂因子的方法,以及一个通过对输入文本的标签和混杂因子都进行预测来“遗忘”混杂特征模型;但我们以交替方式对抗式地训练两个预测器,以学习预测正确标签但不易利用混杂因子信息的文本表示。我们表明该模型泛化更好,并学习了指示写作风格而非内容的特征。
引用
@article{arxiv.1909.00453,
title = {Topics to Avoid: Demoting Latent Confounds in Text Classification},
author = {Sachin Kumar and Shuly Wintner and Noah A. Smith and Yulia Tsvetkov},
journal= {arXiv preprint arXiv:1909.00453},
year = {2021}
}
备注
2019 Conference on Empirical Methods in Natural Language Processing (EMNLP 2019)