基于检索增强从噪声数据学习鲁棒命名实体识别器
计算与语言
2024-07-29 v1 人工智能
摘要
命名实体识别(NER)模型常常在噪声输入(如拼写错误或光学字符识别生成的错误)上表现不佳,学习鲁棒的 NER 模型具有挑战性。现有的鲁棒 NER 模型在训练时会利用噪声文本及其对应的金标准文本,这在许多实际应用中不可行,因为金标准文本不可得。本文考虑更现实的场景,即仅存在噪声文本及其 NER 标签。我们提出从知识语料库中检索与噪声文本相关文本,以增强原始噪声输入的表征。我们设计了三种检索方法:基于词典相似性的稀疏检索、基于语义相似性的稠密检索,以及基于任务特定文本的自检索。检索到相关文本后,我们将检索文本与原始噪声文本拼接,并使用 transformer 网络进行编码,利用自注意力机制通过检索文本增强噪声文本的上下文标记表征。我们进一步采用多视角训练框架,在推理时无需检索文本即可实现鲁棒 NER。实验表明,我们的检索增强模型在各种噪声 NER 设置下均取得显著改进。
关键词
引用
@article{arxiv.2407.18562,
title = {Learning Robust Named Entity Recognizers From Noisy Data With Retrieval Augmentation},
author = {Chaoyi Ai and Yong Jiang and Shen Huang and Pengjun Xie and Kewei Tu},
journal= {arXiv preprint arXiv:2407.18562},
year = {2024}
}