TSDAE:基于 Transformer 的序列去噪自编码器用于无监督句向量学习
计算与语言
2021-09-13 v3
摘要
学习句向量通常需要大量标注数据。然而,对于大多数任务和领域,标注数据很少可用且创建成本高昂。在这项工作中,我们提出一种基于预训练 Transformers 和序列去噪自编码器(TSDAE)的新最先进无监督方法,其以多达 6.4 分的优势优于先前方法。它可达到领域内监督方法性能的 93.1%。此外,我们表明 TSDAE 是一种强大的领域自适应和句向量预训练方法,显著优于如掩码语言模型等其他方法。先前研究的一个关键缺陷是评估狭窄:大多数工作主要在语义文本相似度(STS)这一单一任务上评估,而该任务不需要任何领域知识。尚不清楚这些所提方法是否能推广到其他领域和任务。我们填补了这一空白,并在来自异质领域的四个不同数据集上评估 TSDAE 及其他近期方法。
引用
@article{arxiv.2104.06979,
title = {TSDAE: Using Transformer-based Sequential Denoising Auto-Encoder for Unsupervised Sentence Embedding Learning},
author = {Kexin Wang and Nils Reimers and Iryna Gurevych},
journal= {arXiv preprint arXiv:2104.06979},
year = {2021}
}
备注
Accepted at EMNLP 2021 Findings