中文

面向 Transformer 语音处理的无训练谱特征指纹

计算与语言 2025-10-23 v1 机器学习 信号处理 机器学习

摘要

不同的 Transformer 架构通过不同的连接模式实现相同的语言计算,产生可通过谱分析检测到的模型烙印的"计算特征指纹"。我们对注意力诱导的 token 图进行图信号处理,跟踪在三种模型家族中,对 20 种语言进行语音转换时,代数连通性(Fiedler 值,Δλ2\Delta\lambda_2)的变化,指定的早期窗口为层 2--5。我们的分析发现清晰的架构特征:Phi-3-Mini 显示出 dramatic 的英语特定早层扰动(Δλ2[2,5] ⁣ ⁣0.446\overline{\Delta\lambda_2}_{[2,5]}\!\approx\!-0.446),而其他 19 种语言的影响很小,这与公开文档一致,该文档将该模型主要定位为英语用途。Qwen2.5-7B 显示出小且分布的偏移,最大化的语言为形态丰富的语言;LLaMA-3.2-1B 表现出系统性但温和的响应。这些谱特征与行为差异(Phi-3: r=0.976r=-0.976)高度相关,并受到针对性注意力头剔除的调制,链接效应到早期注意力结构并确认功能相关性。综上所述,这些发现一致于训练重点可留下可检测计算烙印的观点:特殊化的处理策略表现为在语法转换期间可测 connectivity 模式。除语音转换外,该框架还能区分推理模式,表明其作为简单、无训练诊断工具以揭示架构偏见并支持模型可靠性分析具有实用价值。

关键词

引用

@article{arxiv.2510.19131,
  title  = {Training-Free Spectral Fingerprints of Voice Processing in Transformers},
  author = {Valentin Noël},
  journal= {arXiv preprint arXiv:2510.19131},
  year   = {2025}
}

备注

Preprint under review (2025). 12 pages, 8 figures