机器生成文本黑盒检测器的解释方法评估
机器学习
2026-01-21 v2 计算与语言
摘要
区分语言模型生成文本与人类撰写文本的日益困难促使了机器生成文本(MGT)检测器的开发。然而,在许多场景下,黑盒预测并不充分,了解检测器基于何种依据做出该预测同样重要。估计特征重要性的解释方法有望指示分类器在预测时使用了输入的哪些部分。然而,这些方法通常使用对人类直观的简单分类器和任务进行评估。为了评估它们在这些场景之外的适用性,本研究对 MGT 检测器的解释质量进行了首次系统性评估。通过五项自动化实验评估了忠实性和稳定性这两个维度,并通过用户研究评估了有用性。我们使用了一个由 ChatGPT 生成和人类撰写的文档组成的数据集,并将三种现有的基于语言模型的检测器的预测与相应的 SHAP、LIME 和 Anchor 解释相配对。我们发现,SHAP 在忠实性、稳定性以及帮助用户预测检测器行为方面表现最佳。相比之下,被用户认为最有用的 LIME 在预测检测器行为的用户表现上得分最差。
引用
@article{arxiv.2408.14252,
title = {An Evaluation of Explanation Methods for Black-Box Detectors of Machine-Generated Text},
author = {Loris Schoenegger and Yuxi Xia and Benjamin Roth},
journal= {arXiv preprint arXiv:2408.14252},
year = {2026}
}
备注
11 pages; added figures and discussion, improved writing