基于随机过程的语言建模
计算与语言
2023-05-12 v2 机器学习
摘要
现代语言模型能够生成高质量的短文本。然而,在生成长文本时,它们常偏离主题或缺乏连贯性。这些问题源于仅下一词的语言建模目标。近期自监督学习的研究表明,模型可通过对比学习获得良好的潜在表示,这对判别任务有效。我们的工作分析了对比表示在生成任务(如长文本生成)中的应用。我们提出一种利用对比表示的方法,称为时间控制(TC)。TC 首先学习目标文本领域的对比表示,然后通过从这些表示解码来生成文本。相较于特定领域方法及跨多种文本领域微调 GPT2,TC 在语篇连贯性上可与专为学习句子表示的方法竞争。在长文本生成设定下,TC 在顺序性(提升达 )与文本长度一致性(提升达 )方面均保持了文本结构。
引用
@article{arxiv.2203.11370,
title = {Language modeling via stochastic processes},
author = {Rose E Wang and Esin Durmus and Noah Goodman and Tatsunori Hashimoto},
journal= {arXiv preprint arXiv:2203.11370},
year = {2023}
}
备注
Correct claims on goal-directed decoding, adds non-goal-directed baselines. ICLR 2022 Oral. Code: https://github.com/rosewang2008/language_modeling_via_stochastic_processes