技能路径:从电路图中解析语言技能
计算与语言
2025-11-11 v3 人工智能
摘要
电路图发现已成为阐明语言模型技能机制的基本方法。尽管电路图在输出忠实性方面表现可靠,但其存在原子化剖减问题,导致连接组件之间因果依赖关系的丢失。此外,其发现过程旨在保持输出忠实性,却不慎捕获除目标单一技能之外的多余效应。为缓解这些挑战,我们引入技能路径(skill paths),通过在组件线性链中隔离 individual skills,提供更精细且紧凑的表述。为实现从电路图中提取技能路径,我们提出了三步框架,包括分解、修剪和后修剪因果中介。在此基础上,我们提供了完整的Transformer模型线性分解,导致解耦计算图。修剪后,我们进一步采用反事实和干预等因果分析技术,从电路图中提取最终技能路径。为凸显技能路径的重要性,我们使用该框架探讨了三个通用语言技能——Previous Token Skill、Induction Skill 和 In-Context Learning Skill。实验支持这些技能的两个关键属性,即分层性和包容性。
关键词
引用
@article{arxiv.2410.01334,
title = {Skill Path: Unveiling Language Skills from Circuit Graphs},
author = {Hang Chen and Jiaying Zhu and Xinyu Yang and Wenya Wang},
journal= {arXiv preprint arXiv:2410.01334},
year = {2025}
}
备注
accepted by AAAI 2026 (oral)