在GPT-2中识别动词变位电路
计算与语言
2025-06-30 v1 机器学习
摘要
我实现了一个程序来隔离和解释GPT-2小模型负责主语-动词一致性的子网络(或“电路”)。在本研究中,该模型被给定主语为单数(例如“Alice”)或复数(例如“Alice and Bob”)的提示,任务是正确预测相应的动词形式(单数主语对应“walks”,复数主语对应“walk”)。通过一系列技术——包括性能验证、通过直接路径修补实现的自动电路发现,以及直接逻辑归因——我隔离了一个对模型正确动词变位贡献显著的候选电路。结果表明,仅需网络中少数组件-标记对即可在基本任务上实现接近模型性能,但在更复杂的情境下则需要更多。
引用
@article{arxiv.2506.22105,
title = {Identifying a Circuit for Verb Conjugation in GPT-2},
author = {David Demitri Africa},
journal= {arXiv preprint arXiv:2506.22105},
year = {2025}
}