维特根斯坦表示假说:语言是多模态收敛的吸引子吗?
人工智能
2026-05-12 v1
摘要
理解为什么来自不同模态的独立训练神经网络会收敛于共享表示,以及这种收敛导向何处,仍然是表示学习中的一个开放问题。所有现有证据都依赖于对称相似性度量,这些度量可以检测收敛,但在结构上对其方向视而不见。我们引入了使用 cycle-kNN(一种非对称对齐度量)的方向性收敛分析,应用于跨越点云、视觉和语言的数十个独立训练的单模态模型。我们发现了一致的方向性不对称:非语言模态向语言邻域结构的移动显著多于反向移动,并且这种模式在所有模型家族和规模中均成立——然而这对对称度量来说是完全不可见的。机制分析将这种方向性追溯到特征密度不对称,即语言表示占据了表示空间中最紧凑的区域。信息瓶颈框架提供了原则性的解释:压缩下的优化驱使表示趋向于语言特有的离散、组合结构。我们将其形式化为维特根斯坦表示假说:语言的语义结构是多模态表示收敛的渐近吸引子。
引用
@article{arxiv.2605.09352,
title = {The Wittgensteinian Representation Hypothesis: Is Language the Attractor of Multimodal Convergence?},
author = {Zhaoyang Zhang and Run Shao and Dongyue Wu and Jiajie Teng and Chao Tao and Jingdong Chen and Haifeng Li},
journal= {arXiv preprint arXiv:2605.09352},
year = {2026}
}
备注
22 pages, 11 figures, 6 tables