中文

从幻觉到结构雪崩:受限解码在LLM反思中的对齐成本

计算与语言 2026-04-08 v1

摘要

大型语言模型(LLM)内在的自我纠正在开放式推理任务中常常失败,导致“幻觉雪崩”,即模型在自由文本反思中递归合理化早期错误。尽管结构化反馈可缓解此问题,但现有方法常依赖外部训练的批评者或符号工具,降低代理的自主性。本研究探讨了仅通过Outlines-based受限解码强制结构化反思,是否能够在无需额外训练的情况下中断错误传播。我们评估了一个80亿参数模型(Qwen3-8B),结果表明,仅施加结构约束并不能提升自我纠正性能,反而触发了新的失效模式,称为“结构雪崩”。我们发现,满足严格格式规则所需的认知负荷会将模型推入格式陷阱。这一观察帮助解释了为何代理虽实现近乎完美的表面语法对齐,却未能检测或解决更深层的语义错误。这些发现暴露了受限解码固有的“对齐成本”,凸显了结构细粒度与内部模型容量在自主工作流程中的张力。代码和原始日志已提供:https://github.com/hongxuzhou/agentic_llm_structured_self_critique

关键词

引用

@article{arxiv.2604.06066,
  title  = {From Hallucination to Structure Snowballing: The Alignment Tax of Constrained Decoding in LLM Reflection},
  author = {Hongxu Zhou},
  journal= {arXiv preprint arXiv:2604.06066},
  year   = {2026}
}