中文

大型语言模型对文本扰动的鲁棒性

计算与语言 2025-10-08 v2 人工智能

摘要

拥有干净的数据集一直是大多数自然语言处理(NLP)系统的基础假设。然而,在现实场景中很少能找到正确书写的文本,因此,这常常使上述基础假设失效。最近,大型语言模型(LLM)展示了令人印象深刻的性能,但它们能否处理现实世界数据中不可避免的噪声?本文通过研究LLM对文本形态变化的韧性来探讨这一关键问题。为此,我们人为地向一组多样化的数据集中引入不同级别的噪声,并系统地评估LLM对原始文本损坏变体的鲁棒性。我们的研究结果表明,与普遍看法相反,生成式LLM对文本中的噪声扰动相当鲁棒。这与预训练模型(如BERT或RoBERTa)不同,后者的性能已被证明对噪声文本的退化敏感。此外,我们在多个密切模拟常见现实世界错误的真实基准上测试了LLM的韧性。通过最少的提示,LLM在语法错误纠正(GEC)和词汇语义变化(LSC)基准任务上达到了新的最先进水平。为了推动未来的研究,我们还发布了一个由人工标注的数据集,其中包含他们对LLM与人工纠正输出的偏好,以及用于重现我们结果的代码。

关键词

引用

@article{arxiv.2407.08989,
  title  = {Robustness of Large Language Models to Perturbations in Text},
  author = {Ayush Singh and Navpreet Singh and Shubham Vatsal},
  journal= {arXiv preprint arXiv:2407.08989},
  year   = {2025}
}

备注

8 pages, 1 figure, 6 tables, updated with results also from GPT-4, LLaMa-3