中文

基于随机过程的语言建模

计算与语言 2023-05-12 v2 机器学习

摘要

现代语言模型能够生成高质量的短文本。然而,在生成长文本时,它们常偏离主题或缺乏连贯性。这些问题源于仅下一词的语言建模目标。近期自监督学习的研究表明,模型可通过对比学习获得良好的潜在表示,这对判别任务有效。我们的工作分析了对比表示在生成任务(如长文本生成)中的应用。我们提出一种利用对比表示的方法,称为时间控制(TC)。TC 首先学习目标文本领域的对比表示,然后通过从这些表示解码来生成文本。相较于特定领域方法及跨多种文本领域微调 GPT2,TC 在语篇连贯性上可与专为学习句子表示的方法竞争。在长文本生成设定下,TC 在顺序性(提升达 +15%+15\%)与文本长度一致性(提升达 +90%+90\%)方面均保持了文本结构。

关键词

引用

@article{arxiv.2203.11370,
  title  = {Language modeling via stochastic processes},
  author = {Rose E Wang and Esin Durmus and Noah Goodman and Tatsunori Hashimoto},
  journal= {arXiv preprint arXiv:2203.11370},
  year   = {2023}
}

备注

Correct claims on goal-directed decoding, adds non-goal-directed baselines. ICLR 2022 Oral. Code: https://github.com/rosewang2008/language_modeling_via_stochastic_processes