中文

模型说“走”:表面启发式如何覆盖LLM推理中的隐式约束

计算与语言 2026-04-23 v2 人工智能

摘要

当显著的表面线索与未明说的可行性约束冲突时,大型语言模型会系统性失败。我们通过一个“诊断-测量-桥接-治疗”框架对此进行研究。对六个模型的“洗车问题”进行因果行为分析,揭示了近似上下文无关的S形启发式:距离线索的影响力比目标高出8.7到38倍,且词元级归因显示的模式更符合关键词关联而非组合推理。启发式覆盖基准(HOB)——包含500个实例,涵盖4种启发式与5种约束族,并配有最小对和显式性梯度——在14个模型上展示了普遍性:在严格评估(10/10正确)下,没有模型超过75%,且存在性约束最难(44%)。一个最小提示(例如,强调关键对象)平均恢复了+15个百分点,表明失败在于约束推理而非知识缺失;12/14的模型在移除约束时表现更差(最多-39个百分点),揭示了保守偏差。参数化探针证实S形模式泛化到成本、效率和语义相似性启发式;目标分解提示通过强制模型在回答前枚举前提条件恢复了+6到9个百分点。总之,这些结果将启发式覆盖定性为一种系统性推理漏洞,并提供了一个衡量解决该问题进展的基准。

关键词

引用

@article{arxiv.2603.29025,
  title  = {The Model Says Walk: How Surface Heuristics Override Implicit Constraints in LLM Reasoning},
  author = {Yubo Li and Lu Zhang and Tianchong Jiang and Ramayya Krishnan and Rema Padman},
  journal= {arXiv preprint arXiv:2603.29025},
  year   = {2026}
}