Sentence-T5:基于预训练文本到文本模型的可扩展句子编码器
计算与语言
2021-12-15 v3
摘要
我们首次探索了从文本到文本 transformer(T5)中提取句子嵌入。句子嵌入对语言处理任务具有广泛用途。虽然 T5 在被视为序列到序列映射问题的语言任务上取得了令人印象深刻的性能,但如何由编码器-解码器模型产生句子嵌入尚不清楚。我们研究了三种提取 T5 句子嵌入的方法:两种仅使用 T5 编码器,一种使用完整的 T5 编码器-解码器模型。为支持我们的研究,我们建立了一个新的句子表示迁移基准 SentGLUE,它将 SentEval 工具包扩展到来自 GLUE 基准的九个任务。我们的仅编码器模型在 SentEval 和 SentGLUE 迁移任务(包括语义文本相似度(STS))上均优于 Sentence-BERT 和 SimCSE 句子嵌入。发现将 T5 从数百万参数扩展到数十亿参数可产生一致的进一步提升。最后,我们的编码器-解码器方法在使用句子嵌入的 STS 上达到了新的 SOTA。我们的模型发布于 https://tfhub.dev/google/collections/sentence-t5/1。
引用
@article{arxiv.2108.08877,
title = {Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models},
author = {Jianmo Ni and Gustavo Hernández Ábrego and Noah Constant and Ji Ma and Keith B. Hall and Daniel Cer and Yinfei Yang},
journal= {arXiv preprint arXiv:2108.08877},
year = {2021}
}