基于投影的端侧文本表示对拼写错误的鲁棒性
计算与语言
2021-04-27 v3 机器学习
摘要
近期,开发运行于手机、手表和 IoT 等个人设备上的自然语言应用以保全用户隐私并降低内存占用,引起了强烈兴趣。基于局部敏感哈希(LSH)的投影网络的进展已展示出在各类分类任务中最先进的性能,其通过即时计算文本表示而无需显式的词(或词片)嵌入查找表。在本文中,我们表明基于投影的神经网络分类器天生对输入文本的拼写错误与扰动具有鲁棒性。我们经实证演示,相较于 BiLSTM(采用词片与仅词两种分词方式)和微调 BERT 方法,LSH 投影分类器对常见拼写错误更为鲁棒。在遭受拼写错误攻击时,LSH 投影分类器在多个分类任务上的平均准确率仅下降 2.94%,而微调 BERT 模型准确率则显著下降 11.44%。
引用
@article{arxiv.1908.05763,
title = {On-Device Text Representations Robust To Misspellings via Projections},
author = {Chinnadhurai Sankar and Sujith Ravi and Zornitsa Kozareva},
journal= {arXiv preprint arXiv:1908.05763},
year = {2021}
}
备注
EACL 2021