几何对齐成本:分词化 vs. 连续几何在科学基础模型中的比较
机器学习
2026-04-07 v1 信息论
math.IT
定量方法
机器学习
摘要
生物学和物理学的基础模型在优化预测准确性方面表现出色,但其内部表征在系统建模中系统性地未能保持连续几何。我们识别出根本原因:几何对齐税(Geometric Alignment Tax),即将连续流形强行通过离散分类瓶颈所产生的内在成本。在合成动力学系统上的受控消除实验表明,用连续头部取代交叉熵,可将几何失真降低最高可达8.5倍,而学习的代码本表现出非单调的双向困境:更细粒度的量化反而会恶化几何,尽管提升了重构质量。在连续目标下,三种架构仅有1.3倍的差异;而在离散分词化下,它们却差异达3000倍。我们对14个生物学基础模型应用率失真理论和MINE,识别出三种失效模式:局部-全局解耦、表征压缩和几何虚无。受控实验确认,Evo 2在真实DNA上的反向互补鲁棒性反映的是保守序列组成,而非学习到的对称性。没有任何模型能同时实现低失真、高互信息和全局一致性。
引用
@article{arxiv.2604.04155,
title = {The Geometric Alignment Tax: Tokenization vs. Continuous Geometry in Scientific Foundation Models},
author = {Prashant C. Raju},
journal= {arXiv preprint arXiv:2604.04155},
year = {2026}
}