TRACE:用于跟踪Transformer中语义表示出现的诊断框架
计算与语言
2025-05-26 v1
摘要
现代Transformer模型在训练期间表现出相位转变,即从记忆向抽象的明确转变,但支撑这些转变的机制仍不为人知。先前的工作常关注终端表示或孤立信号,如曲率或互信息,通常在符号或算术领域,忽略了语言结构的出现。我们提出TRACE(Tracking Representation Abstraction and Compositional Emergence),一种结合几何、信息和语言信号的诊断框架,用于检测Transformer-based语言模型中的相位转变。TRACE利用框架语义数据生成方法ABSynth,产生带可控复杂度、词汇分布和结构熵的带注释合成语料库,完全标注了语言类别,使我们能够精确分析抽象的出现。实验显示:(i)相位转变与曲率坍缩与维度稳定之间清晰的交叉点一致;(ii)这些几何偏移与新出现的语法和语义准确率相吻合;(iii)抽象模式在不同架构变体中持续存在,前馈网络组件影响优化稳定性而非根本性地改变轨迹。本工作推进了我们对如何在语言模型中产生语言抽象的理解,为模型可解释性、训练效率和组合化泛化提供了洞见,为制定更原则的方法指导大型语言模型的开发。
关键词
引用
@article{arxiv.2505.17998,
title = {TRACE for Tracking the Emergence of Semantic Representations in Transformers},
author = {Nura Aljaafari and Danilo S. Carvalho and André Freitas},
journal= {arXiv preprint arXiv:2505.17998},
year = {2025}
}