中文

利用预训练语言模型生成数据集

计算与语言 2021-10-05 v3 机器学习

摘要

为从预训练语言模型(PLMs)获得高质量句子嵌入,它们必须辅以额外的预训练目标或在大量标注文本对上微调。尽管后一种方法通常优于前一种,但它需要大量人力来生成规模足够的合适数据集。在本文中,我们展示了如何利用PLMs在无需标注数据、微调或修改预训练目标的情况下获得高质量句子嵌入:我们利用大型高性能PLMs的生成能力从零生成整个标注文本对数据集,随后将其用于微调小得多且更高效的模型。我们完全无监督的方法在多个语义文本相似度数据集上优于强基线。

关键词

引用

@article{arxiv.2104.07540,
  title  = {Generating Datasets with Pretrained Language Models},
  author = {Timo Schick and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2104.07540},
  year   = {2021}
}

备注

Accepted at EMNLP2021