大型语言模型精细调优中的人工纠缠
机器学习
2026-01-27 v1 人工智能
高能物理 - 理论
量子物理
机器学习
摘要
大型语言模型 (LLM) 可通过仅修改少量可训练参数的 参数高效微调 (PEFT) 方法进行任务适应,通常通过低秩更新实现。本文我们采用量子信息学的视角来理解其有效性。从这一视角来看,低秩参数化自然对应于低维矩阵产品态 (MPS) 表示,这使得基于纠缠的特征描述参数结构成为可能。因此,我们提出并度量了“人工纠缠”概念,即人工神经网络(特别是 LLM)参数的纠缠熵。我们首先研究了代表性的低秩适应 (LoRA) PEFT 方法,以及全参数微调 (FFT),使用 LLaMA 模型在 1B 和 8B 规模上训练,并在 Tulu3 和 OpenThoughts3 数据集上进行训练,发现:(i) LoRA 中查询和值投影矩阵更新过程的内部人工纠缠遵循体积定律,伴随中心抑制(称为“纠缠谷”),该现象对超参数敏感,且与 FFT 中的纠缠性质不同;(ii) 注意力矩阵中的外部人工纠缠对应于表示空间中的 token-token 相关性,遵循面积定律并伴随对数修正, Despite LoRA 超参数和训练步数的变化仍保持稳健。 Drawing a parallel to the No-Hair Theorem in black hole physics, 我们提出尽管 LoRA 和 FFT 诱导不同的内部纠缠特征,但这些差异在注意力输出中并不显现,这表明低秩更新具有“无发饰”特性,导致其有效性。我们进一步基于随机矩阵理论提供了理论支持,并将分析扩展到一种 MPS 适应 PEFT 方法,该方法 exhibit 类似的定性行为。
引用
@article{arxiv.2601.06788,
title = {Artificial Entanglement in the Fine-Tuning of Large Language Models},
author = {Min Chen and Zihan Wang and Canyu Chen and Zeguan Wu and Manling Li and Junyu Liu},
journal= {arXiv preprint arXiv:2601.06788},
year = {2026}
}
备注
41 pages, many figures