ENIGMA:大语言模型中的推理与对齐几何
机器学习
2025-10-17 v2 人工智能
计算与语言
摘要
我们提出了 Entropic Mutual-Information Geometry Large-Language Model Alignment (ENIGMA),这是一种新颖的大语言模型 (LLM) 训练方法,通过将组织的政策/原则视为在模型信息流形上移动的方向,联合提高推理、对齐和鲁棒性。我们的单环训练器结合了 Group-Relative Policy Optimisation (GRPO),这是一种基于策略的、无评论家的强化学习方法,仅使用 Chain-of-Thought (CoT) 格式奖励;一种 Self-Supervised Alignment with Mutual Information (SAMI) 风格的对称 InfoNCE 辅助;以及对隐藏状态分布施加的熵 Sinkhorn 最优传输正则化,以限制几何漂移。我们还引入了可针对匹配负样本的标准 MI 下界进行特化的 infoNCE 指标,用于衡量模型 CoT 编码这些政策的强度。这些指标包括 Sufficiency Index (SI),用于在训练前选择和创建最大化下游性能的原则。在我们使用小规模 (1B) 大语言模型的实验中,高 SI 原则预测了更平稳的训练动力学和更好的基准性能,优于 GRPO 消融实验。我们对训练后模型的信息几何分析验证了理想的结构变化。这些结果支持我们的假设,即推理、对齐和鲁棒性是单个信息几何目标的投影,使用 ENIGMA 训练的模型在不使用奖励模型的情况下表现出原则化的推理,为可信赖的能力提供了一条路径。
引用
@article{arxiv.2510.11278,
title = {ENIGMA: The Geometry of Reasoning and Alignment in Large-Language Models},
author = {Gareth Seneque and Lap-Hang Ho and Nafise Erfanian Saeedi and Jeffrey Molendijk and Ariel Kuperman and Tim Elson},
journal= {arXiv preprint arXiv:2510.11278},
year = {2025}
}
备注
52 pages, 10 figures, author typo corrected, abstract typo corrected