中文

系链推理:通过流形引导解耦量化大语言模型中的熵与幻觉

机器学习 2026-02-23 v1 计算与语言

摘要

量化语言模型面临一个根本困境:低采样温度会产生重复、模式坍缩的输出,而高温度(T > 2.0)则会导致轨迹发散和语义不连贯。我们提出了HELIX,一个通过将隐藏状态轨迹系链到预先计算的真实性流形来解耦输出熵与幻觉的几何框架。HELIX计算一个统一真实度分数,该分数结合了令牌级语义熵与到流形的马氏距离。当UTS指示轨迹发散时,渐进式引导向量将激活重定向到结构连贯的区域,同时仅影响0.2-2.5%的令牌。在4比特量化的Granite 4.0 H Small(32B/9B活跃,混合Mamba-Transformer)上:GSM8K在T = 3.0时保持88.84%的准确率(相比T = 0.5下降2.81个百分点);MMLU在14,042个问题上保持72.49%的准确率(下降1.24个百分点)。这表明高温幻觉主要是轨迹发散而非语义崩溃。值得注意的是,引导稀疏的Transformer注意力层(约10%的层)足以纠正Mamba-2状态空间公式中的漂移。几何系链揭示了一个先前被掩盖的高熵创意储备。在T > 2.0时,引导后的输出表现出5-20%的想法重复,而在保守设置下为70-80%。跨架构验证(Qwen3-30B-A3B MOE)证实了这一现象与架构无关,独特概念生成率高出46.7%。HELIX充当一个语法系链,使得在探索语义多样性的同时,不违反有效输出所需的逻辑主干。这使得多温度合成成为可能,生成的独特概念比单温度推理多200%。

关键词

引用

@article{arxiv.2602.17691,
  title  = {Tethered Reasoning: Decoupling Entropy from Hallucination in Quantized LLMs via Manifold Steering},
  author = {Craig Atkinson},
  journal= {arXiv preprint arXiv:2602.17691},
  year   = {2026}
}

备注

16 pages, 6 tables