中文

当模型忽略定义:衡量 LLM 推理中的语义覆盖幻觉

硬件体系结构 2026-02-20 v1

摘要

大型语言模型 (LLM) 在标准数字逻辑和布尔推理任务上表现出强大的能力,但其在局部重新定义语义下的可靠性仍鲜有了解。在许多正式场景中,例如电路规范、考试和硬件文档中,运算符和组件被明确在局部范围内重新定义。正确推理需要模型暂时抑制全球学习的惯例,以适应提示中局部定义的语义。本 work 我们研究了一种系统性失效模式,称为语义覆盖 (semantic override),即 LLM 在提示中明确重新定义后,仍会回归到其预训练的默认运算符或门行为解释。我们还识别了一类相关错误,称为假设注入 (assumption injection),即当关键细节未充分指定时,模型会就硬件语义作出未表述的假设,而不是请求澄清。我们引入了一个包含30个逻辑和数字电路推理任务的紧凑微基准,设计为验证器风格的陷阱,涵盖布尔代数、运算符重载、重新定义的门以及电路层次语义。评估了三种前沿 LLM,观察到对局部规范的持续不遵从、自信且不兼容的假设,以及即使在基础设置下也会丢弃约束。我们的发现凸显了表面正确性与规范忠实推理之间的差距,激励开发显式测试局部忘却和语义合规性的评估协议,以应对正式领域中的语义覆盖问题。

关键词

引用

@article{arxiv.2602.17520,
  title  = {When Models Ignore Definitions: Measuring Semantic Override Hallucinations in LLM Reasoning},
  author = {Yogeswar Reddy Thota and Setareh Rafatirad and Homayoun Houman and Tooraj Nikoubin},
  journal= {arXiv preprint arXiv:2602.17520},
  year   = {2026}
}