TracLLM: 面向长上下文 LLM 的通用归因框架
密码学与安全
2025-06-27 v3 人工智能
机器学习
摘要
长上下文大语言模型 (LLM) 已在诸如检索增强生成 (RAG)、agent 以及广泛集成 LLM 的应用中得到部署。给定指令和长上下文(如文档、PDF 文件、网页),长上下文 LLM 可生成基于所提供上下文的输出,旨在提供更准确、更及时且可验证的输出,同时减少幻觉和不受支持的主张。这引出了一个研究问题:如何定位 LLM 生成输出所贡献最大或负责的上下文中的文本(如句子、段落或章节)?我们称此过程为上下文 traceback。其应用场景包括 1) 调试 LLM 基于系统, 2) 对针对 LLM 的攻击(如提示注入攻击、知识破坏攻击)进行事后取证分析,以及 3) 突出显示知识来源以增强用户对 LLM 生成的输出信任。针对长上下文 LLM 的上下文 traceback,现有特征归因方法如 Shapley 在性能和计算成本方面表现不佳。本文发展了 TracLLM,首个针对长上下文 LLM 的通用上下文 traceback 框架。我们的框架可提高现有特征归因方法的有效性和效率。为提高效率,我们开发了基于受启发搜索的算法于 TracLLM 中。我们还开发了贡献得分集成/去噪技术以提高 TracLLM 的准确性。我们的评估结果表明,TracLLM 能有效识别导致 LLM 输出的长上下文中的文本。我们的代码和数据可在 https://github.com/Wang-Yanting/TracLLM 查阅。
引用
@article{arxiv.2506.04202,
title = {TracLLM: A Generic Framework for Attributing Long Context LLMs},
author = {Yanting Wang and Wei Zou and Runpeng Geng and Jinyuan Jia},
journal= {arXiv preprint arXiv:2506.04202},
year = {2025}
}
备注
To appear in USENIX Security Symposium 2025. The code and data are at: https://github.com/Wang-Yanting/TracLLM