压缩破解:从几何畸变看语言模型的informatics 属性的补充视角
计算与语言
2025-11-07 v3
摘要
最近,“压缩即智能”这一概念为语言模型 (LM) 提供了一种新颖的信息论度量视角,强调高度结构化的表示标志着 LM 的智能水平。然而,从几何角度看,高度压缩的 LM 的词表示空间倾向于退化为高度各向异性状态,这会阻碍 LM 理解指令并直接影响其性能。我们发现,这种压缩-各向异性同步现象本质上是 LM 表示中的“压缩破解”,即噪声主导的方向通过牺牲空间均匀性来制造高压缩率的假象。基于此,我们提出了通过纳入几何畸变分析来细化三个压缩指标,并将其集成到自评估管道中。细化后的指标在与 LM 综合能力的对齐方面表现出极强的性能,Spearman 相关系数超过 0.9,显著优于原始压缩和其他基于内部结构的度量。这一发现确认,压缩破解通过纳入表示的几何畸变,显著增强了 LM 信息论解释的深度。
关键词
引用
@article{arxiv.2505.17793,
title = {Compression Hacking: A Supplementary Perspective on Informatics Properties of Language Models from Geometric Distortion},
author = {Jianxiang Zang and Meiling Ning and Yongda Wei and Shihan Dou and Jiazheng Zhang and Nijia Mo and Binhong Li and Tao Gui and Qi Zhang and Xuanjing Huang},
journal= {arXiv preprint arXiv:2505.17793},
year = {2025}
}