噪声文本数据:基于 transformer 的流行 NLP 模型的阿喀琉斯之踵
计算与语言
2021-10-08 v1 人工智能
机器学习
摘要
在过去几年中,机器学习社区基于 transformer 架构创建了许多新的 NLP 模型。这些模型在各种基准数据集的 NLP 任务上表现出色,常常超越 SOTA 结果。受此成功鼓舞,人们经常发现工业界从业者积极尝试微调这些模型以构建面向工业用例的 NLP 应用。然而,对于从业者用于构建工业 NLP 应用的大多数数据集,很难保证数据中不存在任何噪声。尽管大多数基于 transformer 的 NLP 模型在将一个数据集的学习迁移到另一个数据集方面表现极为出色,但当在噪声文本上微调时这些模型的表现仍不清楚。我们针对 Kumar 等人(2020)提出的开放问题,探究流行的基于 transformer 的 NLP 模型对文本数据中噪声的敏感性。我们继续采用他们所定义的噪声——拼写错误与笔误(最常见发生的噪声)。我们通过实验结果表明,这些模型在基准数据集上的大多数常见 NLP 任务(即文本分类、文本相似度、NER、问答、文本摘要)上表现糟糕。我们进一步表明,随着数据中噪声增加,性能下降。我们的发现表明,在微调流行的基于 transformer 的 NLP 模型时,必须警惕数据集中噪声的存在。
引用
@article{arxiv.2110.03353,
title = {Noisy Text Data: Achilles' Heel of popular transformer based NLP models},
author = {Kartikay Bagla and Ankit Kumar and Shivam Gupta and Anuj Gupta},
journal= {arXiv preprint arXiv:2110.03353},
year = {2021}
}