中文

语义管道预测:通过JEPA超越LLM数据效率

机器学习 2026-02-27 v1

摘要

大型语言模型(LLMs)遵循一致的比例定律——即经验幂律拟合预测损失随计算、数据和参数的变化关系。尽管这些定律具有预测性,但它们是描述性的而非命令式的:它们刻画典型训练,而非最优训练。意外的是,极少数工作成功挑战了这些定律所暗示的数据效率下限——这正是我们的主要关注点。为此,我们提出几何假设(Geodesic Hypothesis),即令牌序列在光滑语义流形上沿测地线,因而在局部上为线性。基于这一原则,我们提出一种新的语义管道预测(STP)任务,一种JEPA风格的正则化器,将隐藏状态轨迹限制在测地线的管状邻域内。STP将JEPA推广至语言领域,无需显式的多视图增强。我们表明,这一约束提高了信噪比,从而通过防止推理期间轨迹碰撞来保持多样性。经验上,STP使LLMs在NL-RX-SYNTH数据集上仅使用16倍训练数据即可匹配基线准确度,直接违反了Chinchilla式比例定律的数据项,表明以原则几何先验可超越粗暴扩张。代码地址:https://github.com/galilai-group/llm-jepa#stp

关键词

引用

@article{arxiv.2602.22617,
  title  = {Semantic Tube Prediction: Beating LLM Data Efficiency with JEPA},
  author = {Hai Huang and Yann LeCun and Randall Balestriero},
  journal= {arXiv preprint arXiv:2602.22617},
  year   = {2026}
}

备注

21 pages, 13 figures