为表征而生成:GUR 预训练框架
计算与语言
2023-06-21 v1 信息检索
摘要
近年来,大量高质量预训练模型涌现,极大影响了自然语言理解(NLU)、自然语言生成(NLG)与文本表征任务。传统上,这些模型在定制领域语料上预训练并针对特定任务微调,导致 GPU 使用与人工方面的高成本。遗憾的是,近期语言建模的趋势转向通过扩大规模提升性能,进一步加剧了相关成本。本文引入 GUR:一种在单步训练中结合语言建模与对比学习目标的预训练框架。我们基于原始无标注文档的最长公共子串(LCS)选取相似文本对,并使用掩码语言建模与无监督对比学习训练模型。所得模型 GUR 在没有任何标注训练数据的情况下取得了令人印象深刻的成果,在零样本设置的召回基准上作为检索器优于所有其他预训练基线。此外,如我们的消融实验所示,GUR 保持了其语言建模能力。我们的代码可在 \url{https://github.com/laohur/GUR} 获取。
引用
@article{arxiv.2306.10056,
title = {Generate to Understand for Representation},
author = {Changshang Xue and Xiande Zhong and Xiaoqing Liu},
journal= {arXiv preprint arXiv:2306.10056},
year = {2023}
}