LLM-JEPA: 大语言模型与联合嵌入预测架构的融合
计算与语言
2025-10-08 v2 人工智能
摘要
大语言模型(LLM)的预训练、微调和评估依赖于输入空间重构和生成能力。然而,在视觉领域已发现,基于嵌入空间的训练目标(例如联合嵌入预测架构 JEPA)远优于其输入空间对应方法。语言与视觉在训练方式上的这种不匹配引发了一个自然问题:{语言训练方法能否从视觉方法中学习一些技巧?} 缺乏 JEPA 风格的 LLM 证明了为语言设计此类目标的挑战。在本工作中,我们提出了该方向的第一步,开发了 LLM-JEPA,这是一种适用于微调和预训练的基于 JEPA 的 LLM 解决方案。到目前为止,LLM-JEPA 在所有模型上均以显著优势超越了标准 LLM 训练目标,同时对过拟合具有鲁棒性。这些发现在多个数据集(NL-RX、GSM8K、Spider、RottenTomatoes)和多种模型(Llama3、OpenELM、Gemma2 和 Olmo 系列)中均得到验证。代码:https://github.com/rbalestr-lab/llm-jepa.
引用
@article{arxiv.2509.14252,
title = {LLM-JEPA: Large Language Models Meet Joint Embedding Predictive Architectures},
author = {Hai Huang and Yann LeCun and Randall Balestriero},
journal= {arXiv preprint arXiv:2509.14252},
year = {2025}
}