中文

LEDOM:逆向语言模型

计算与语言 2026-03-04 v3 人工智能

摘要

自回归语言模型仅从左到右进行训练。我们探索了互补的分解方式,即从右到左进行大规模训练,并询问当模型以未来语境为条件来预测过去时,是否会涌现出不同的推理模式。我们训练了 LEDOM,这是一个开源的纯逆向自回归语言模型(2B/7B 参数,435B token),发现其发展出与前向模型截然不同的能力,包括归纳推理、问题合成和对 reversal curse 的自然解决。我们随后探索了逆向模型的一个应用:通过噪声信道二义性将前向似然 P(y|x) 与逆向后验 P(x|y) 结合起来。我们提出了 Reverse Reward,通过逆向后验估计对前向输出进行重新排序,并证明了双向评分会惩罚其反向重构下降的幻觉推理链。Reverse Reward 在 AIME 2024 上可获得最高 6.6% 的提升,在 AMC 2023 上可获得最高 15% 的提升。我们在此发布所有模型、代码和数据。

关键词

引用

@article{arxiv.2507.01335,
  title  = {LEDOM: Reverse Language Model},
  author = {Xunjian Yin and Sitao Cheng and Yuxi Xie and Xinyu Hu and Li Lin and Xinyi Wang and Liangming Pan and William Yang Wang and Xiaojun Wan},
  journal= {arXiv preprint arXiv:2507.01335},
  year   = {2026}
}

备注

Work in progress; Models can be found at: https://huggingface.co/Corning/Reverse-Model-7B-348B/tree/main