"我知道自己更好,但并不完全更好":LLM能否检测和解释LLM生成的文本?
计算与语言
2025-06-25 v2 人工智能
摘要
区分人类和LLM生成的文本在鉴别LLM滥用风险方面至关重要。本文调查了当前LLM在检测和解释能力方面的表现,涵盖两个场景:二元分类(人类 vs. LLM生成)和三元分类(包括"难以判断"类别)。我们评估了6种不同规模的闭源和开源LLM,发现自检测(LLM识别自身输出)始终优于交叉检测(识别来自其他LLM的输出),尽管两者都不理想。引入三元分类框架可在所有模型上提高检测准确率和解释质量。通过使用我们的人工标注数据集进行全面定量和定性分析,我们识别出关键解释失效,主要包括对不准确特征的依赖、幻觉以及错误推理。我们的发现凸显了当前LLM在自我检测和自我解释方面的局限性,突显了进一步研究以解决过拟合问题并提升通用性的需要。
引用
@article{arxiv.2502.12743,
title = {"I know myself better, but not really greatly": How Well Can LLMs Detect and Explain LLM-Generated Texts?},
author = {Jiazhou Ji and Jie Guo and Weidong Qiu and Zheng Huang and Yang Xu and Xinru Lu and Xiaoyu Jiang and Ruizhe Li and Shujun Li},
journal= {arXiv preprint arXiv:2502.12743},
year = {2025}
}
备注
Under review