使用预训练语言模型欺骗 MOSS 检测
计算与语言
2022-09-08 v2 人工智能
摘要
随着人工智能(AI)技术变得日益强大并在社会中凸显,其滥用问题日益受到关注。在教育环境中,学生可能利用 AI 技术在与作业和考试相关的任务中作弊。本文探讨是否可利用 transformer 完成入门级编程作业,同时规避常用的 AI 工具以检测软件间的相似性。我们发现,使用 GPT-J [Wang and Komatsuzaki, 2021] 的学生能够完成入门级编程作业而不引起 MOSS [Aiken, 2000](一种广泛使用的软件相似度与 plagiarism 检测工具)的怀疑。尽管 GPT-J 并未在相关问题上训练,且未提供任何示例可供参考,上述情况依然成立。我们进一步发现,GPT-J 编写的代码结构多样,缺乏未来 plagiarism 检测技术可能用以识别算法生成代码的特定痕迹。最后我们讨论了大语言模型(LLM)的伦理与教育影响以及未来研究方向。
引用
@article{arxiv.2201.07406,
title = {Fooling MOSS Detection with Pretrained Language Models},
author = {Stella Biderman and Edward Raff},
journal= {arXiv preprint arXiv:2201.07406},
year = {2022}
}
备注
To appear in the Proceedings of the 29th ACM International Conference on Information & Knowledge Management (CIKM)