面向通用文本嵌入的多阶段对比学习
计算与语言
2023-08-08 v1
摘要
我们提出 GTE,一种采用多阶段对比学习训练的通用文本嵌入模型。顺应近期将各类 NLP 任务统一为单一格式的趋势,我们通过跨多来源数据集混合上的对比学习训练统一的文本嵌入模型。通过在无监督预训练与有监督微调两阶段均大幅扩充训练数据量,我们相较现有嵌入模型取得了实质性性能提升。值得注意的是,即便参数规模仅为 110M,GTE 在大规模文本嵌入基准上优于 OpenAI 提供的黑盒嵌入 API,甚至超越参数规模大 10 倍的文本嵌入模型。此外,无需针对每种编程语言单独微调,我们的模型通过将代码视为文本,优于此前同规模的最佳代码检索器。总之,我们的模型通过有效利用多阶段对比学习取得了令人印象深刻的结果,提供了一种强大且高效的文本嵌入模型,可广泛适用于各类 NLP 与代码相关任务。
引用
@article{arxiv.2308.03281,
title = {Towards General Text Embeddings with Multi-stage Contrastive Learning},
author = {Zehan Li and Xin Zhang and Yanzhao Zhang and Dingkun Long and Pengjun Xie and Meishan Zhang},
journal= {arXiv preprint arXiv:2308.03281},
year = {2023}
}