ORION:教会语言模型以“思维语言”中高效推理
人工智能
2025-12-01 v1 计算与语言
机器学习
摘要
大型推理模型(LRMs)在数学、代码生成和任务规划方面取得了强大的性能,但其依赖冗长的“思考”标记导致延迟高、冗余且不连贯的推理路径。灵感来自“思维语言假说”,该假说认为人类推理操作于一种符号化、组合化的心理语言(称为Mentalese)之上。我们引入一种框架,通过训练模型以类似的方式进行推理。Mentalese 将抽象推理编码为超紧凑的、结构化标记,使模型能够以更少的步骤解决复杂问题。为提高效率和准确性,我们提出了更短长度偏好优化(SHORTER LENGTH PREFERENCE OPTIMIZATION, SLPO),这是一种强化学习方法,对保持正确性且保持简洁性的解决方案给予奖励,同时仍允许在需要时使用更长的推理。应用于Mentalese对齐的模型后,SLPO显著提高了压缩率,通过启用简洁推理来实现,这在保持详细思考的益处而不增加计算开销方面。在包括AIME 2024和2025、MinervaMath、OlympiadBench、Math500和AMC在内的多个基准测试中,我们的ORION模型产生的推理痕迹token数减少了4-16倍,推理延迟降低了最高5倍,训练成本降低了7-9倍,同时保持了90-98%的准确率。ORION在准确性上超过Claude和ChatGPT-4o最高可达5%,同时实现2倍的压缩。这些结果表明,Mentalese风格的压缩推理是通向类人认知效率的一步,使实时、成本效益的推理成为可能,而不牺牲准确性。
引用
@article{arxiv.2511.22891,
title = {ORION: Teaching Language Models to Reason Efficiently in the Language of Thought},
author = {Kumar Tanmay and Kriti Aggarwal and Paul Pu Liang and Subhabrata Mukherjee},
journal= {arXiv preprint arXiv:2511.22891},
year = {2025}
}