中文

知道何时停止:文本生成中语义漂移的研究

计算与语言 2024-04-09 v1

摘要

在这项工作中,我们明确表明,现代 LLM 倾向于先生成正确的事实,然后“漂移”并在随后生成不正确的事实:这一点偶尔被观察到,但从未被恰当测量。我们开发了一个语义漂移分数,用于测量生成文本中正确事实与不正确事实之间的分离程度,并在生成维基百科风格的传记时证实了我们的假设。这种先正确后错误的生成模式表明,可以通过知道何时停止生成来提高事实准确性。因此,我们探讨了几种提前停止方法在信息量与事实准确性之间的权衡,并设法大幅提高了事实性。我们进一步表明,与基线相比以及与提前停止相结合时,使用语义相似度进行重排序可以进一步改善这些结果。最后,我们尝试调用外部 API 将模型带回正确的生成路径,但未获得积极结果。总体而言,我们的方法具有通用性,可应用于任何长篇文本生成,通过平衡事实准确性、信息量和计算成本之间的权衡来产生更可靠的信息。

关键词

引用

@article{arxiv.2404.05411,
  title  = {Know When To Stop: A Study of Semantic Drift in Text Generation},
  author = {Ava Spataru and Eric Hambro and Elena Voita and Nicola Cancedda},
  journal= {arXiv preprint arXiv:2404.05411},
  year   = {2024}
}