黑箱语言模型的 token 重要性可视化
计算与语言
2025-12-15 v1 机器学习
摘要
我们关注的是审计黑箱大型语言模型(LLM)以确保其在部署到生产环境时行为可靠的问题,特别是在法律、医疗和监管合规等高风险领域。现有的 LLM 审计方法通常只关注模型行为的特定方面,如检测特定偏见或评估公平性。我们感兴趣的是更一般的问题——我们能否理解黑箱 LLM 的输出如何依赖于每个输入 token?在依赖不可访问 API 端点的实际应用中,迫切需要此类工具。然而,这是一个高度非平凡的问题,因为 LLM 是随机函数(即两个输出会因随机性而不同),而计算 prompt 级别的梯度来近似输入灵敏度又不可行。为此,我们提出了分布基灵敏度分析(DBSA),这是一种轻量级、无需对 LLM 做任何分布性假设的模型中性程序,用于评估语言模型输出对于每个输入 token 的灵敏度。DBSA 作为面向实践者的实用工具,使能够快速、即插即用地探索 LLM 对特定输入 token 的依赖性。通过示例,我们展示了 DBSA 如何能够帮助用户检查 LLM 输入,发现可能被现有 LLM 可解释性方法所忽略的灵敏度。
引用
@article{arxiv.2512.11573,
title = {Visualizing token importance for black-box language models},
author = {Paulius Rauba and Qiyao Wei and Mihaela van der Schaar},
journal= {arXiv preprint arXiv:2512.11573},
year = {2025}
}