中文

LLM 生成文本中文体变异的基准测试

计算与语言 2025-09-22 v2 人工智能

摘要

本研究调查了人类撰写文本与大型语言模型(LLM)生成的可比文本之间的语域变异。将 Biber 的多维度分析(MDA)应用于人类撰写文本样本及为与之对应而生成的 AI 文本,以找出 LLM 与人类差异最显著且最系统的变异维度。作为文本材料,本文使用了一个新的 LLM 生成语料库 AI-Brown,其与 BE-21(一个代表当代英国英语的 Brown 语料库家族)具有可比性。由于在前沿 LLM 的训练数据中,除英语外的所有语言均代表性不足,本文使用 AI-Koditex 语料库和捷克语多维度模型,对捷克语进行了类似分析的复制。考察了 16 个前沿模型在不同设置和提示下的表现,重点关注基础模型与指令微调模型之间的差异。基于此,本文创建了一个基准,通过该基准可以在可解释的维度上对模型进行比较和排名。

关键词

引用

@article{arxiv.2509.10179,
  title  = {Benchmark of stylistic variation in LLM-generated texts},
  author = {Jiří Milička and Anna Marklová and Václav Cvrček},
  journal= {arXiv preprint arXiv:2509.10179},
  year   = {2025}
}

备注

Data and scripts: https://osf.io/hs7xt/. Interactive charts: https://www.korpus.cz/stylisticbenchmark/