面向噪声输入的 NLP 模型受限输出空间的有限上下文索引
计算与语言
2023-10-24 v1
摘要
NLP 模型在干净输入的任务上表现出色,但在噪声输入下准确性较低。特别是,字符级噪声如人工书写的错别字和经过对抗设计的逼真错拼常出现在文本中,并容易使 NLP 模型出错。先前解决字符级噪声的方案常改变输入内容(低保真度),从而无意中降低了模型在干净输入上的准确性。我们提出 FiRo,一种在不牺牲干净输入性能的前提下提升 NLP 模型在噪声输入上性能的方法。FiRo 通过推断输入中每个词元的无噪声形式来净化输入文本,同时保留其保真度。FiRo 使用有限上下文聚合获取上下文嵌入,并据此在受限输出空间中找到无噪声形式。输出空间被限制为一个小的可能候选簇,以更准确地预测无噪声词元。尽管簇很小,FiRo 的有效词表(所有簇的并集)可扩展得更大以更好地保留输入内容。实验结果表明,使用 FiRo 的 NLP 模型在六个分类任务和一个序列标注任务上以不同噪声程度优于基线。
引用
@article{arxiv.2310.14110,
title = {Finite-context Indexing of Restricted Output Space for NLP Models Facing Noisy Input},
author = {Minh Nguyen and Nancy F. Chen},
journal= {arXiv preprint arXiv:2310.14110},
year = {2023}
}
备注
Accepted at IJCNLP-AACL 2023