中文

面向审计与引导的概念级别可解释性

计算与语言 2025-05-20 v2 人工智能

摘要

随着大型语言模型(LLM)的广泛部署,关于其安全性和对齐性的担忧日益增长。引导 LLM 行为的一种方法是识别哪些提示部分影响模型输出的特定方面。标记级别归因方法为解决这一问题提供了前景,但在文本生成中仍然难以处理,因为它们仅解释输出中每个标记的存在,而非整个 LLM 响应的底层语义。我们引入 ConceptX,这是一种模型不可知的概念级别可解释性方法,通过识别提示中概念(即语义丰富的标记)并根据输出的语义相似性为其分配重要性。与当前的标记级别方法不同,ConceptX 还通过原位替换标记来保持上下文完整性,并支持灵活的解释目标,例如性别偏见。ConceptX 使我们能够进行审计,通过揭示偏见来源进行引导,通过修改提示来转变情感或减少 LLM 响应的有害性,而无需重新训练。在三个 LLM 上,ConceptX 在忠实性和人类对齐方面均优于 TokenSHAP 等标记级别方法。在引导任务中,情感转变提升 0.252(相对于随机编辑的 0.131),攻击成功率从 0.463 降至 0.242,优于归因和改写基线。虽然提示工程和自解释方法有时会产生更安全的响应,但 ConceptX 提供了一种透明且忠实的替代方案,用于改进 LLM 的安全性和对齐性,展示了归因基础可解释性在指导 LLM 行为方面的实际价值。

关键词

引用

@article{arxiv.2505.07610,
  title  = {Concept-Level Explainability for Auditing & Steering LLM Responses},
  author = {Kenza Amara and Rita Sevastjanova and Mennatallah El-Assady},
  journal= {arXiv preprint arXiv:2505.07610},
  year   = {2025}
}

备注

9 pages, 7 figures, Submission to Neurips 2025