噪声文本数据:BERT 的阿喀琉斯之踵
计算与语言
2020-10-20 v3
摘要
由于 BERT 在各种 NLP 任务和基准数据集上的巨大成功,工业界从业者正积极尝试微调 BERT 以构建解决行业用例的 NLP 应用。对于从业者用于构建工业 NLP 应用的大多数数据集,很难保证数据中不存在任何噪声。虽然 BERT 在将一个用例的学习迁移到另一用例方面表现极为出色,但当在噪声文本上微调时 BERT 的表现仍不清楚。在这项工作中,我们探究了 BERT 对数据中噪声的敏感性。我们处理最常出现的噪声(拼写错误、笔误),并表明这会导致 BERT 性能显著下降。我们给出实验结果以表明,在基准数据集即 IMDB Movie Review、STS-B、SST-2 上存在(模拟)噪声时,BERT 在情感分析和文本相似性等基础 NLP 任务上的性能显著下降。此外,我们指出了现有 BERT 流程中导致此性能下降的缺陷。我们的发现表明,从业者在微调 BERT 解决行业用例时需要注意数据集中噪声的存在。
引用
@article{arxiv.2003.12932,
title = {Noisy Text Data: Achilles' Heel of BERT},
author = {Ankit Kumar and Piyush Makhija and Anuj Gupta},
journal= {arXiv preprint arXiv:2003.12932},
year = {2020}
}
备注
7 pages, 2 tables, 1 plot