Grover化是否值得?变换器中泛化电路的功能分析与迁移性
计算与语言
2026-01-15 v1 人工智能
摘要
虽然大型语言模型(LLM)在事实性检索方面表现出色,但在组合任务中常常受到“双跳推理”诅咒的制约。最近的研究表明,参数共享变换器可以通过延长的“grokking”阶段形成“泛化电路”来弥合这一差距。一个根本性的问题随之而来:grokked模型在下游任务上是否优于非grokked模型?此外,等待grokking阶段的大量计算成本是否值得?本文我们进行一次机制性研究,评估泛化电路在知识吸收与迁移中的作用。我们展示了:(i)非grokked模型和grokked模型在分布外的组合查询上建立的推理路径是相同的。这表明“泛化电路”并不代表新推理范式的突然获得。相反,我们认为grokking是将记忆的原子事实整合到自然建立的推理路径中过程。(ii)在延长训练后实现对未见情况的高精度以及形成某种推理路径并不相互绑定;在特定数据条件下,它们可以独立发生。(iii)即使是一个成熟的电路在整合新知识时也表现出有限的迁移性,这表明“grokked”变换器并未实现对组合逻辑的完全掌控。
引用
@article{arxiv.2601.09049,
title = {Is Grokking Worthwhile? Functional Analysis and Transferability of Generalization Circuits in Transformers},
author = {Kaiyu He and Zhang Mian and Peilin Wu and Xinya Du and Zhiyu Chen},
journal= {arXiv preprint arXiv:2601.09049},
year = {2026}
}