中文

爆发与否:生成与量化非似然文本

计算与语言 2024-01-30 v1

摘要

尽管大型语言模型(LLMs)在文本生成方面能力极强,但其输出仍可与人类撰写的文本区分开来。我们通过多种文本指标、多种采样技术、多种文本数据类型,并在两个流行的LLM——LLaMA和Vicuna上,探索了这种差异。在此过程中,我们引入了一个新指标——可恢复性(recoverability),以突出人类与机器文本之间的差异;并提出了一种新的采样技术——爆发采样(burst sampling),旨在缩小这一差距。我们发现,LLaMA和Vicuna在许多指标下具有不同的分布,这影响了我们的结果:当使用LLaMA时,可恢复性在区分真实与虚假文本方面优于任何其他指标。当使用Vicuna时,与其他采样技术相比,爆发采样生成的文本在分布上更接近真实文本。

关键词

引用

@article{arxiv.2401.15476,
  title  = {To Burst or Not to Burst: Generating and Quantifying Improbable Text},
  author = {Kuleen Sasse and Samuel Barham and Efsun Sarioglu Kayi and Edward W. Staley},
  journal= {arXiv preprint arXiv:2401.15476},
  year   = {2024}
}

备注

Originally published at the Generation, Evaluation & Metrics (GEM) Workshop at EMNLP 2023. We are awaiting the release of the proceedings which we will reference here