正交潜在空间下的LLM输出纠正
机器学习
2026-05-14 v1 人工智能
摘要
可靠地大语言模型(LLM)用于医疗保健的关键步骤是将预测归因于其训练数据,类似于医学病例研究。这需要 token 级别的精确性:不仅要确定哪些训练示例影响决策,还要确定其中哪些 token 对决策负责。虽然影响函数提供了原则性框架,但先前工作仅限于自回归场景,依赖隐式的 token 独立性假设,导致其识别的影响不可靠。我们提出一种灵活框架,通过潜在中介方法推断 token 级别的影响,以适用于一般预测任务。该方法为预训练LLM的任意层附加稀疏自动编码器,以学习大约独立的潜在特征基。与先前方法不同,计算得到的影响在 token 级别上本质上是不可分解的。为此,我们提出一种新方法使用雅可比-向量积。通过 token 激活模式将潜在归因反向传播到输入空间。我们通过高效的逆Hessian近似实现了该方法的规模化。实验在医疗基准测试上表明,我们的方法识别出稀疏且可解释的 token 集合,这些 token 共同影响预测。我们的框架提升了信任度,使模型审计成为可能,适用于需要透明和可解释决策的高风险领域。
关键词
引用
@article{arxiv.2605.12809,
title = {Correcting Influence: Unboxing LLM Outputs with Orthogonal Latent Spaces},
author = {Shixing Yu and Promit Ghosal and Kyra Gan},
journal= {arXiv preprint arXiv:2605.12809},
year = {2026}
}