Imitate Before Detect:对机器修订文本的机器风格偏好进行对齐
计算与语言
2024-12-24 v2 人工智能
密码学与安全
摘要
大语言模型(LLMs)彻底改变了文本生成方式,使得检测机器生成文本变得日益困难。尽管过去的方法在检测纯机器生成文本方面取得了良好成绩,但这些检测器在区分机器修订文本(重写、扩展和润色)方面表现不佳,而后者与原始人类提示之间的差异仅微小。由于文本内容可能源自人类提示,检测机器修订文本往往涉及识别机器风格特征,例如LLM偏好的措辞。然而,现有方法难以检测被隐藏于人类贡献内容中的机器风格措辞。我们提出“Imitate Before Detect”(ImBD)方法,首先模仿机器风格词汇分布,然后将待检测文本的分布与机器风格分布进行比较,以确定文本是否被机器修订。为此,我们引入风格偏好优化(SPO),将评分LLM模型对齐机器生成文本的偏好。对齐后的评分模型用于计算风格条件概率曲率(Style-CPC),量化原始文本与条件采样文本之间对数概率差,以实现有效检测。我们在各种场景下进行了广泛比较,包括来自六种LLMs的文本修订、四种不同文本领域以及三种机器修订类型。与现有最先进方法相比,我们的方法在检测开源LLMs修订文本时,AUC提升13个百分点;分别对GPT-3.5和GPT-4o修订文本提升5个百分点和19个百分点。值得注意的是,我们仅需1,000个样本和5分钟SPO,即可超越专为商业训练的GPT-Zero,显示出其高效与有效。
引用
@article{arxiv.2412.10432,
title = {Imitate Before Detect: Aligning Machine Stylistic Preference for Machine-Revised Text Detection},
author = {Jiaqi Chen and Xiaoye Zhu and Tianyang Liu and Ying Chen and Xinhui Chen and Yiwen Yuan and Chak Tou Leong and Zuchao Li and Tang Long and Lei Zhang and Chenyu Yan and Guanghao Mei and Jie Zhang and Lefei Zhang},
journal= {arXiv preprint arXiv:2412.10432},
year = {2024}
}
备注
To appear at AAAI 2025. 14 pages, 6 figure