快速、有效且自监督:将掩码语言模型转化为通用词法与句子编码器
计算与语言
2021-09-10 v2 人工智能
机器学习
摘要
预训练的掩码语言模型(MLMs)近年来彻底改变了 NLP。然而,先前工作表明,现成的 MLMs 在没有使用标注任务数据在 NLI、句子相似度或释义任务上进一步进行任务特定微调时,作为通用词法或句子编码器是无效的。在本工作中,我们证明即使没有任何额外数据且没有任何监督,也可以将 MLMs 转化为有效的通用词法与句子编码器。我们提出了一种极其简单、快速且有效的对比学习技术,称为 Mirror-BERT,它能在 20-30 秒内将 MLMs(如 BERT 和 RoBERTa)转化为此类编码器,无需任何额外外部知识。Mirror-BERT 依赖完全相同或略微修改的字符串对作为正例(即同义)微调样本,并旨在身份微调期间最大化其相似度。我们报告了 Mirror-BERT 在词法级和句子级任务上相对于现成 MLMs 的巨大提升,跨不同领域和不同语言。值得注意的是,在标准句子语义相似度(STS)任务中,我们的自监督 Mirror-BERT 模型甚至匹配了先前工作中任务微调的 Sentence-BERT 模型的性能。最后,我们深入探究 MLMs 的内部机制,并提供了一些关于为何这种简单方法能产生有效通用词法与句子编码器的证据。
引用
@article{arxiv.2104.08027,
title = {Fast, Effective, and Self-Supervised: Transforming Masked Language Models into Universal Lexical and Sentence Encoders},
author = {Fangyu Liu and Ivan Vulić and Anna Korhonen and Nigel Collier},
journal= {arXiv preprint arXiv:2104.08027},
year = {2021}
}
备注
EMNLP 2021 camera-ready version