中文

我们称之为干预:探索语言模型适应非标准文本的基本障碍

计算与语言 2025-03-25 v3

摘要

我们提出了一系列实验,以理解语言模型适应非标准文本的潜在挑战。我们通过设计干预措施来近似用户生成文本的核心特征及其与语言模型现有偏见的相互作用。在语言模型适应非标准文本变体的过程中应用我们的干预措施,我们获得了关于这种适应何时成功的重要见解,以及文本变体和噪声中语言模型特别难以处理的方面。例如,在字符级变体的文本上,即使只增加少量训练样本,开箱即用的性能也会提高,但会接近一个平台,这表明更多的数据不是解决方案。相比之下,在涉及新词或新含义的变体文本上,需要更多的数据,但这会导致性能的巨大突破。我们的发现表明,现有模型缺乏处理多种形式非标准文本的必要基础设施,从而指导了更具弹性的语言建模技术的发展。我们将干预措施的代码公开,这些代码可应用于任何英文文本数据。

关键词

引用

@article{arxiv.2404.07304,
  title  = {We're Calling an Intervention: Exploring Fundamental Hurdles in Adapting Language Models to Nonstandard Text},
  author = {Aarohi Srivastava and David Chiang},
  journal= {arXiv preprint arXiv:2404.07304},
  year   = {2025}
}

备注

Accepted for publication at W-NUT 2025