用 LOVE 插补词表外嵌入以极低代价增强语言模型鲁棒性
计算与语言
2022-03-22 v2
摘要
最先进的 NLP 系统以词嵌入表示输入,但面对词表外(OOV)词时这些表示十分脆弱。为解决此问题,我们遵循 mimick 类模型的原则,仅利用词的表层形式学习预训练嵌入的行为,从而为未见词生成向量。我们提出了一个简单的对比学习框架 LOVE,它扩展了现有预训练语言模型(如 BERT)的词表示,并以极少额外参数使其对 OOV 具备鲁棒性。大量评估表明,我们的轻量模型在原始数据集和损坏变体上的表现均与先前竞争方法相当甚至更优。此外,它可与 FastText 和 BERT 以即插即用的方式结合,显著提升其鲁棒性。
引用
@article{arxiv.2203.07860,
title = {Imputing Out-of-Vocabulary Embeddings with LOVE Makes Language Models Robust with Little Cost},
author = {Lihu Chen and Gaël Varoquaux and Fabian M. Suchanek},
journal= {arXiv preprint arXiv:2203.07860},
year = {2022}
}
备注
Long paper accepted by ACL main conference. 17 pages