在代码内容上评估AIGC检测器
软件工程
2023-04-12 v1
摘要
人工智能生成内容(AIGC)因其令人印象深刻的性能而受到相当关注,ChatGPT作为领先的AIGC模型,在包括软件开发与维护在内的各类应用中生成高质量回复。尽管潜力巨大,ChatGPT的滥用引发了重大担忧,尤其在教育和安全关键领域。众多AIGC检测器已在自然语言数据上开发并评估。然而,它们在ChatGPT生成的代码相关内容上的表现仍未被探索。为填补此空白,本文首次提出在软件领域评估现有AIGC检测器的实证研究。我们创建了一个包含492.5K样本的综合数据集,涵盖ChatGPT产生的代码相关内容,包括热门软件活动如问答(115K)、代码摘要(126K)和代码生成(226.5K)。我们评估了六种AIGC检测器,包括三种商业和三种开源方案,在该数据集上评测其性能。此外,我们开展了人类研究以理解人类检测能力,并与现有AIGC检测器比较。结果表明,相较于自然语言数据,AIGC检测器在代码相关数据上表现更低。微调可提升检测器性能,尤其对同域内内容;但泛化仍具挑战。人类评估显示人工检测相当困难。
引用
@article{arxiv.2304.05193,
title = {Evaluating AIGC Detectors on Code Content},
author = {Jian Wang and Shangqing Liu and Xiaofei Xie and Yi Li},
journal= {arXiv preprint arXiv:2304.05193},
year = {2023}
}