中文

几何对齐成本:分词化 vs. 连续几何在科学基础模型中的比较

机器学习 2026-04-07 v1 信息论 math.IT 定量方法 机器学习

摘要

生物学和物理学的基础模型在优化预测准确性方面表现出色,但其内部表征在系统建模中系统性地未能保持连续几何。我们识别出根本原因:几何对齐税(Geometric Alignment Tax),即将连续流形强行通过离散分类瓶颈所产生的内在成本。在合成动力学系统上的受控消除实验表明,用连续头部取代交叉熵,可将几何失真降低最高可达8.5倍,而学习的代码本表现出非单调的双向困境:更细粒度的量化反而会恶化几何,尽管提升了重构质量。在连续目标下,三种架构仅有1.3倍的差异;而在离散分词化下,它们却差异达3000倍。我们对14个生物学基础模型应用率失真理论和MINE,识别出三种失效模式:局部-全局解耦、表征压缩和几何虚无。受控实验确认,Evo 2在真实DNA上的反向互补鲁棒性反映的是保守序列组成,而非学习到的对称性。没有任何模型能同时实现低失真、高互信息和全局一致性。

关键词

引用

@article{arxiv.2604.04155,
  title  = {The Geometric Alignment Tax: Tokenization vs. Continuous Geometry in Scientific Foundation Models},
  author = {Prashant C. Raju},
  journal= {arXiv preprint arXiv:2604.04155},
  year   = {2026}
}