中文

面向词级语义相似度的无监督预训练模型专门化

计算与语言 2020-04-21 v2

摘要

无监督预训练模型已被证明可推动广泛的下游 NLP 应用。然而,这些模型保留了传统静态词嵌入的若干局限。特别是,它们仅编码通过语言建模目标从原始文本语料中获得的分布知识。在本工作中,我们用外部词汇知识补充此类分布知识,即将关于词级语义相似度的离散知识整合进预训练。为此,我们将标准 BERT 模型推广到多任务学习设定,将 BERT 的掩码语言建模与下一句预测目标同一个二值词关系分类辅助任务相耦合。我们的实验表明,我们专为词级语义相似度定制的“词汇信息增强”BERT(LIBERT)在若干语言理解任务上优于无词汇信息的“原始”BERT。具体而言,LIBERT 在 GLUE 基准的 10 项任务中有 9 项优于 BERT,并在剩余一项中与 BERT 持平。此外,我们在 3 个词汇简化基准上展示了稳定的提升,而该任务中词级语义相似度知识至关重要。

关键词

引用

@article{arxiv.1909.02339,
  title  = {Specializing Unsupervised Pretraining Models for Word-Level Semantic Similarity},
  author = {Anne Lauscher and Ivan Vulić and Edoardo Maria Ponti and Anna Korhonen and Goran Glavaš},
  journal= {arXiv preprint arXiv:1909.02339},
  year   = {2020}
}