谁写了这句话?评估大语言模型生成的古典中文诗的检测
计算与语言
2026-04-17 v2
摘要
大语言模型(LLM)的快速发展将文本生成任务扩展到了文学领域。然而,AI生成的文学创作正在引发文学界日益突出的创作真实性与伦理问题,使得检测LLM生成的文学文本变得至关重要且迫切。虽然先前工作在检测AI生成文本方面取得了显著进展,但尚未针对古典中文诗歌进行探讨。鉴于古典中文诗歌具有严格的格律规则、共享的诗意意象体系以及灵活的句法结构,区分一首诗是由AI生成还是由人类所作, presents substantial挑战。为此,我们引入了 ChangAn——一个用于检测LLM生成的古典中文诗歌基准数据集,包含30,664首诗歌,其中10,276首为人类所写,20,388首由四款流行LLM生成。基于ChangAn,我们系统评估了12种AI检测器,研究其在不同文本粒度和生成策略下的表现。我们的发现表明,当前的中文文本检测器在检测LLM生成的古典中文诗歌方面存在显著局限,无法作为可靠工具使用。这些结果既验证了我们提出ChangAn基准有效性,也凸显了其必要性。我们的数据集与代码已公开于https://github.com/VelikayaScarlet/ChangAn。
引用
@article{arxiv.2604.10101,
title = {Who Wrote This Line? Evaluating the Detection of LLM-Generated Classical Chinese Poetry},
author = {Jiang Li and Tian Lan and Shanshan Wang and Dongxing Zhang and Dianqing Lin and Guanglai Gao and Derek F. Wong and Xiangdong Su},
journal= {arXiv preprint arXiv:2604.10101},
year = {2026}
}
备注
Accepted to ACL 2026 Main Conference