DPIC:解耦提示与内在特征用于大语言模型生成文本检测
计算与语言
2024-06-13 v3 人工智能
机器学习
摘要
大语言模型(LLMs)有可能生成存在滥用风险的文本,例如 plagiarism、在电商平台上植入虚假评论,或制造煽动性虚假推文。因此,检测文本是否由 LLM 生成变得愈发重要。现有高质量检测方法通常需要访问模型内部以提取内在特征。然而,由于我们无法访问黑盒模型内部,必须借助代理模型,这影响了检测质量。为实现对黑盒模型的高质量检测,我们希望提取黑盒模型生成文本的深层内在特征。我们将生成过程视为提示与生成模型内在特征相耦合的过程。基于这一洞见,我们提出解耦提示与内在特征(DPIC)的 LLM 生成文本检测方法。具体而言,给定候选文本,DPIC 使用一个辅助 LLM 重建对应于该候选文本的提示,然后利用该提示由辅助 LLM 重新生成文本,这使得候选文本与重新生成文本分别与其提示对齐。随后,将候选文本与重新生成文本之间的相似性作为检测特征,从而在检测过程中消除提示,使检测器能够聚焦于生成模型的内在特征。与基线相比,DPIC 在检测由 GPT4 和 Claude3 生成的不同领域文本时,分别实现了平均 6.76% 和 2.91% 的提升。
引用
@article{arxiv.2305.12519,
title = {DPIC: Decoupling Prompt and Intrinsic Characteristics for LLM Generated Text Detection},
author = {Xiao Yu and Yuang Qi and Kejiang Chen and Guoqiang Chen and Xi Yang and Pengyuan Zhu and Xiuwei Shang and Weiming Zhang and Nenghai Yu},
journal= {arXiv preprint arXiv:2305.12519},
year = {2024}
}