利用预训练语言模型生成数据集
计算与语言
2021-10-05 v3 机器学习
摘要
为从预训练语言模型(PLMs)获得高质量句子嵌入,它们必须辅以额外的预训练目标或在大量标注文本对上微调。尽管后一种方法通常优于前一种,但它需要大量人力来生成规模足够的合适数据集。在本文中,我们展示了如何利用PLMs在无需标注数据、微调或修改预训练目标的情况下获得高质量句子嵌入:我们利用大型高性能PLMs的生成能力从零生成整个标注文本对数据集,随后将其用于微调小得多且更高效的模型。我们完全无监督的方法在多个语义文本相似度数据集上优于强基线。
引用
@article{arxiv.2104.07540,
title = {Generating Datasets with Pretrained Language Models},
author = {Timo Schick and Hinrich Schütze},
journal= {arXiv preprint arXiv:2104.07540},
year = {2021}
}
备注
Accepted at EMNLP2021