NoisyCoconut:通过潜在空间推理实现反事实共识
机器学习
2026-05-12 v1 人工智能
摘要
本文提出 NoisyCoconut,一种新颖的推理时方法,通过操控内部表示来增强大语言模型 (LLM) 的可靠性。不同于需要大量再训练的微调方法,NoisyCoconut 直接在推理时对模型表示进行操作,无需再训练。不通过训练模型在潜在空间内推理,而是注入受控噪声到潜在轨迹中,以生成多样化的推理路径。这些路径之间的一致性提供置信信号,使模型在不确定时选择放弃。我们展示,该方法在多个推理基准测试中实现了有效的覆盖-精度权衡,无需访问训练数据或修改模型参数。该方法为提高 LLM 输出的可靠性提供了实用途径,同时保持与现有模型的兼容性。我们的实验表明,单一一致的噪声扰动路径可将错误率从 40-70% 降至 15% 以下,使模型通过选择性放弃在数学推理任务中超过 95% 的准确率。
引用
@article{arxiv.2605.08221,
title = {NoisyCoconut: Counterfactual Consensus via Latent Space Reasoning},
author = {Michael Jerge and David Evans},
journal= {arXiv preprint arXiv:2605.08221},
year = {2026}
}