检测LLM生成的现代中文诗的基准测试
计算与语言
2025-09-03 v1 人工智能
摘要
先进的大型语言模型 (LLM) 的快速发展使得 AI 生成的文本难以与人类撰写的文本区分。以往在检测 AI 生成文本方面的工作取得了有效进展,但尚未涉及现代中文诗歌。由于现代中文诗歌的独特特征,难以判断一首诗是来自人类还是 AI。AI 生成的现代中文诗歌的激增显著扰乱了诗歌生态系统。基于识别 AI 生成的诗歌在现实中文语境中的紧迫需求,本文提出了一个用于检测 LLM 生成的现代中文诗歌的新型基准测试。我们首先构建了一个高质量的数据集,包含 800 首由六位专业诗人所作的诗歌以及 41,600 首由四个主流 LLM 生成的诗歌。随后,我们对六个检测器在该数据集上的系统性能进行评估。实验结果表明,当前的检测器无法作为可靠的工具来检测由 LLM 生成的现代中文诗歌。最难检测的诗歌特征是内在特征,尤其是风格。检测结果验证了我们提出方法的有效性与必要性。我们的工作为未来检测 AI 生成的诗歌奠定了基础。
引用
@article{arxiv.2509.01620,
title = {Benchmarking the Detection of LLMs-Generated Modern Chinese Poetry},
author = {Shanshan Wang and Junchao Wu and Fengying Ye and Jingming Yao and Lidia S. Chao and Derek F. Wong},
journal= {arXiv preprint arXiv:2509.01620},
year = {2025}
}
备注
Accepted by EMNLP 2025