中文

域再生:大语言模型如何匹配文本域的句法属性?

计算与语言 2025-06-03 v2

摘要

近期大语言模型性能的提升,很可能伴随着其对训练数据分布的逼近能力提升。本文探讨了以下问题:大语言模型忠实逼近的文本域属性有哪些,以及它们的逼近程度如何?我们应用了语料库语言学中熟悉的观察方法,让一个常用且开源的大语言模型从两个接受许可的英文文本域(维基百科和新闻文本)中生成文本。这种再生范式允许我们在相当受语义控制的环境中,检验大语言模型是否能够忠实匹配原始人类文本域。我们研究了从更简单属性(如句子长度、文章可读性)到更复杂和更高阶属性(如依存标签分布、解析深度和解析复杂度)的不同层次的句法属性。我们发现,大多数再生分布与人类原始文本相比,均呈现均值偏移、标准差降低以及长尾分布缩减。

关键词

引用

@article{arxiv.2505.07784,
  title  = {Domain Regeneration: How well do LLMs match syntactic properties of text domains?},
  author = {Da Ju and Hagen Blix and Adina Williams},
  journal= {arXiv preprint arXiv:2505.07784},
  year   = {2025}
}