中文

LEA:利用词汇注意力偏置提升句子相似度对错别字的鲁棒性

计算与语言 2023-07-07 v1 人工智能

摘要

文本噪声(如错别字或缩写)是一个众所周知的问题,会使 vanilla Transformers 在大多数下游任务中表现受损。我们表明,对于句子相似度这一在匹配、检索或释义等多个领域中的基础任务,情况同样如此。句子相似度可使用交叉编码器处理,即将两个句子在输入中拼接,使模型能够利用它们之间的相互关系。以往解决噪声问题的工作主要依赖数据增强策略,在处理与训练所用样本相似的受损样本时表现出改进的鲁棒性。然而,这些方法仍受错别字引起的词元分布偏移影响。在本工作中,我们提出通过为交叉编码器配备一种新颖的词汇感知注意力模块(LEA)来解决文本噪声,该模块融合了两组句子中词之间的词汇相似度。通过使用原始文本相似度,我们的方法避免了词元化偏移问题,获得了改进的鲁棒性。我们证明,LEA 引入的注意力偏置有助于交叉编码器应对含文本噪声的复杂场景,特别是在具有短文本描述和有限上下文的领域中。使用三个流行 Transformer 编码器在五个用于产品匹配的电商数据集上的实验表明,LEA 在噪声存在下持续提升性能,同时在原始(干净)划分上保持竞争力。我们还在两个用于文本蕴含和释义的数据集上评估了我们的方法,表明 LEA 在具有较长句子和更自然上下文的领域中同样对错别字鲁棒。此外,我们深入分析了方法中的若干设计选择,提供了关于所做决策影响的见解,并促进未来处理错别字的交叉编码器研究。

关键词

引用

@article{arxiv.2307.02912,
  title  = {LEA: Improving Sentence Similarity Robustness to Typos Using Lexical Attention Bias},
  author = {Mario Almagro and Emilio Almazán and Diego Ortego and David Jiménez},
  journal= {arXiv preprint arXiv:2307.02912},
  year   = {2023}
}

备注

KDD'23 conference (main research track). (*) These authors contributed equally