中文

大规模预训练语言模型是否是更优的故事生成器?

计算与语言 2019-09-25 v1 人工智能 机器学习

摘要

在海量文本上训练的大型神经语言模型已成为自然语言理解任务的一种强大策略。然而,这些模型作为自然语言生成器的能力尚不明晰。尽管轶事证据表明这些模型生成质量更好的文本,但尚无详细研究刻画其生成能力。本文中,我们将广泛预训练的模型OpenAI GPT2-117(Radford等人,2019)与最先进的神经故事生成模型(Fan等人,2018)进行比较。通过跨多种自动指标评估生成文本,我们刻画了预训练模型在哪些方面使故事讲述变得更好或并未变好。我们发现,尽管GPT2-117对上下文条件依赖更强、对事件顺序更敏感并使用更不寻常的词汇,但在使用似然最大化解码算法时,它同样容易产生重复且多样性不足的文本。

关键词

引用

@article{arxiv.1909.10705,
  title  = {Do Massively Pretrained Language Models Make Better Storytellers?},
  author = {Abigail See and Aneesh Pappu and Rohun Saxena and Akhila Yerukola and Christopher D. Manning},
  journal= {arXiv preprint arXiv:1909.10705},
  year   = {2019}
}

备注

Accepted to CoNLL 2019