AttriBoT:高效近似计算leave-one-out上下文归因的技巧
机器学习
2025-03-24 v3
摘要
上下文输入对大型语言模型(LLM)行为的影响,已促进开发上下文归因方法,以量化每个上下文片段对LLM生成的影响。leave-one-out(LOO)误差衡量移除给定上下文片段后,LLM响应概率变化的方法,为上下文归因提供了原则性途径,但对大型模型计算成本高昂。本工作中,我们引入AttriBoT,一种高效计算LOO误差近似值的新技术。具体而言,AttriBoT使用缓存的激活值以避免冗余操作,采用分层归因以减少计算,同时用更小的代理模型模拟大目标模型的行为。综合来看,AttriBoT能在保持对目标模型LOO误差更忠实于先前上下文归因方法的同时,实现>300倍的加速。这一显著的性能提升使计算给定响应的上下文归因速度快于生成响应本身30倍,使能够在大规模应用中计算归因。我们发布了面向用户且高效的AttriBoT实现,以便高效的LLM可解释性以及鼓励未来开发高效的上下文归因方法。
引用
@article{arxiv.2411.15102,
title = {AttriBoT: A Bag of Tricks for Efficiently Approximating Leave-One-Out Context Attribution},
author = {Fengyuan Liu and Nikhil Kandpal and Colin Raffel},
journal= {arXiv preprint arXiv:2411.15102},
year = {2025}
}
备注
24 pages, 11 figures, ICLR 2025