IPAD:面向AI检测的逆向提示方法 - 一种鲁棒且可解释的大语言模型生成文本检测器
软件工程
2025-02-25 v1 计算与语言
摘要
大型语言模型(LLM)在文本生成方面已达到类人水平,这使得区分人类撰写和AI生成的文本变得复杂。这增加了滥用风险,凸显了可靠检测器的必要性。然而,现有检测器在分布外(OOD)数据和受攻击数据上表现差, 这在实际场景中至关重要。此外,它们难以提供可解释的证据来支持其决策,从而削弱了可靠性。鉴于这些挑战,我们提出了IPAD(Inverse Prompt for AI Detection),一个新框架,包括识别输入文本可能生成所需提示的Prompt Inverter(提示词逆转器),以及两个Distinguisher(区分器),用于检验输入文本与预测提示词的匹配程度。经验评估表明,IPAD在分布内数据上的平均召回率优于最强基线提升了9.05%,在分布外数据上的AUROC提升了12.93%,在受攻击数据上的AUROC提升了5.48%。IPAD还在结构化数据集上表现稳健。此外,进行了可解释性评估,说明IPAD通过允许用户直接检查决策依据,增强了AI检测的可信度,为其领先的检测结果提供了可解释支持。
引用
@article{arxiv.2502.15908,
title = {LLMs in Mobile Apps: Practices, Challenges, and Opportunities},
author = {Kimberly Hau and Safwat Hassan and Shurui Zhou},
journal= {arXiv preprint arXiv:2502.15908},
year = {2025}
}