面向生成式AI系统行为的提示-反事实解释
机器学习
2026-01-28 v2 人工智能
计算与语言
计算机与社会
摘要
随着生成式AI系统被集成到实际应用中,组织越来越需要能够理解和解释其行为。特别是,决策者需要理解导致生成式AI系统呈现特定输出特征的原因。在此总体主题下,本文探讨了一个关键问题:输入——提示——是什么导致基于LLM的生成式AI系统产生具有特定特征(如有害性、负面情绪或政治倾向)的输出。为此,我们采用解释性AI文献中常用技术:反事实解释。我们解释了为何不能直接将传统反事实解释应用于生成式AI系统,由于生成式AI系统功能的差异。我们提出了一种灵活的框架,用于在下游分类器可揭示其输出特征的场景下,将反事实解释适应于非确定性、生成式AI系统。基于此框架,我们引入了生成提示-反事实解释(Prompt-Counterfactual Explanations, PCEs)的算法。最后,我们针对三个案例研究演示了生成式AI系统的反事实解释,探讨不同的输出特征(即政治倾向、有害性和情感)。案例研究进一步表明,PCE可以简化提示工程以抑制不希望的输出特征,並能增强红队测试以发现能够激发不希望输出的额外提示。最终,本工作为生成式AI中的提示聚焦可解释性奠定了基础:这一能力将在这些模型被赋予更高风险任务并受到新兴透明度和问责制要求时变得必不可少。
引用
@article{arxiv.2601.03156,
title = {Prompt-Counterfactual Explanations for Generative AI System Behavior},
author = {Sofie Goethals and Foster Provost and João Sedoc},
journal= {arXiv preprint arXiv:2601.03156},
year = {2026}
}