中文

面向文本生成的均匀复杂度

计算与语言 2023-10-23 v3 机器学习

摘要

大语言模型(LLM)在摘要和机器翻译等广泛的生成式 NLP 任务中展现出有前景的结果。然而在叙事生成场景下,现有模型仍未能捕捉有助于生成连贯文本的因素。例如,一段文本或一个故事在整体上应具有均匀的易读性,且这种形式的复杂度应是可控的,这是合乎逻辑的。因此,若输入文本提示在 Flesch 阅读轻松度测试中被评为一年级阅读水平,则延续情节的生成文本也应处于该复杂度范围内。鉴于此,我们提出均匀复杂度文本生成(UCTG),一项新的基准测试,其提出了使生成模型遵循相对于提示的均匀语言属性的挑战。我们实验了 150 多个语言学和认知驱动的用于评估人类与生成模型文本复杂度的特征。从结果中我们发现,诸如 GPT-2 的模型难以保持生成中所用输入提示的复杂度,即使使用专业撰写文本进行微调也是如此。

关键词

引用

@article{arxiv.2204.05185,
  title  = {Uniform Complexity for Text Generation},
  author = {Joseph Marvin Imperial and Harish Tayyar Madabushi},
  journal= {arXiv preprint arXiv:2204.05185},
  year   = {2023}
}

备注

Final camera-ready for EMNLP 2023