查询回路:解释语言模型如何回答用户提示
人工智能
2025-09-30 v1
摘要
解释语言模型为何产生特定输出需要局部的、输入层面的解释。现有方法能揭示全局能力回路(例如间接宾语识别),但无法解释模型为何以特定方式回答特定的输入查询。我们引入查询回路,直接追踪模型内部将特定输入映射到输出的信息流。与基于替代模型的方法(例如稀疏自编码器)不同,查询回路在模型自身内部识别,从而提供更忠实且计算上更易处理的解释。为使查询回路实用化,我们解决了两个挑战。首先,我们引入归一化偏离忠实度(NDF),这是一种稳健的度量指标,用于评估发现的回路对特定输入恢复模型决策的程度,且广泛适用于我们设定之外的回路发现。其次,我们开发了基于采样的方法,以高效识别稀疏且能忠实描述模型行为的回路。在多个基准测试(IOI、算术、MMLU 和 ARC)上,我们发现模型内部存在极其稀疏的查询回路,能够恢复其在单次查询上的大部分性能。例如,仅覆盖 1.3% 模型连接的回路就能恢复 MMLU 问题上约 60% 的性能。总体而言,查询回路向忠实、可扩展地解释语言模型如何处理个体输入迈出了一步。
引用
@article{arxiv.2509.24808,
title = {Query Circuits: Explaining How Language Models Answer User Prompts},
author = {Tung-Yu Wu and Fazl Barez},
journal= {arXiv preprint arXiv:2509.24808},
year = {2025}
}
备注
Preprint. Under review