中文

BERT 能处理多少噪声?来自多语言句子难度检测的洞察

计算与语言 2026-03-10 v1

摘要

噪声训练数据会显著降低基于语言模型的分类器性能,尤其是在非主题分类任务中。本研究设计了方法学框架以评估去噪影响。具体而言,我们探索了多种句子难度检测的去噪策略,训练数据来源于通过噪声众包获取的文档级难度标注。除单语场景外,我们也关注跨语言迁移,即在一种语言中训练多语言语言模型后在另一种语言中进行测试。我们评估了多种噪声减少技术,包括高斯混合模型(GMM)、Co-Teaching、噪声转换矩阵和标签平滑。我们的结果表明,尽管 BERT 模型对噪声具有内在鲁棒性,但 incorporating 明确的噪声检测可进一步提升性能。对于我们较小的数据集,基于 GMM 的噪声过滤在通过将 Area-Under-the-Curve 分数从 0.52 提升至 0.92(或结合去噪方法后达到 0.93)方面尤其有效。然而,对于我们较大的数据集,预训练语言模型的内在正则化提供了强大的基线,去噪方法仅带来轻微收益(从 0.92 提升至 0.94,而两种去噪方法的组合未产生贡献)。尽管如此,移除约 20% 的噪声句子有助于产生更干净的语料库,减少不完整之处。因此,我们发布了最大的多语言句子难度预测语料库:见 https://github.com/Nouran-Khallaf/denoising-difficulty

关键词

引用

@article{arxiv.2603.07346,
  title  = {How Much Noise Can BERT Handle? Insights from Multilingual Sentence Difficulty Detection},
  author = {Nouran Khallaf and Serge Sharoff},
  journal= {arXiv preprint arXiv:2603.07346},
  year   = {2026}
}