基于可解释性的 LLM 生成文本令牌替换
计算与语言
2026-01-06 v2 人工智能
摘要
生成模型,特别是大语言模型(LLM),在生成看似人类化的文本方面显示出显著进展。然而,它们往往表现出模式,使得其输出比人类撰写的文本更容易被检测。本文调查可解释人工智能(XAI)方法如何用于减少 AI 生成文本(AIGT)的可检测性,同时引入一种鲁棒的基于集成的检测方法。我们首先训练一个集成分类器来区分 AIGT 和人类撰写的文本,然后应用 SHAP 和 LIME 来识别最强烈影响其预测的令牌。我们提出了四种基于可解释性的令牌替换策略,以修改这些有影响力的令牌。我们的发现表明,这些令牌替换方法可以显著削弱单个分类器检测 AIGT 的能力。然而,我们的集成分类器在多个语言和领域中保持强大的性能,表明多模型方法可以抵消令牌级操作的影响。这一结果表明,XAI 方法可以通过聚焦于最具影响力的令牌来使 AIGT 更难被检测。与此同时,它们突显了针对隐藏 AIGT 的不断演变方法而构建鲁棒、基于集成的检测策略的必要性。
引用
@article{arxiv.2506.04050,
title = {Explainability-Based Token Replacement on LLM-Generated Text},
author = {Hadi Mohammadi and Anastasia Giachanou and Daniel L. Oberski and Ayoub Bagheri},
journal= {arXiv preprint arXiv:2506.04050},
year = {2026}
}