中文

Syntactic Framing Fragility: An Audit of Robustness in LLM Ethical Decisions

计算与语言 2026-04-03 v2 人工智能

摘要

大语言模型表现出系统性的否定敏感性,然而在部署规模上,尤其是在高风险决策中,尚无操作框架来衡量这一脆弱性。我们引入了句法框架脆弱性(SFF),一个用于量化在逻辑等价的句法转换下决策一致性的框架。SFF 通过逻辑极性归一化隔离句法效应,从而能够在控制极性反转的同时,直接比较肯定和否定框架下的决策,并提供句法变异指数(SVI)作为适用于 CI/CD 集成的鲁棒性度量指标。通过对 23 个模型在 14 个高风险场景(39,975 个决策)中进行审计,我们为先前仅被定性描述的现象确立了真实效应量,并发现开源模型表现出的脆弱性是商业模型的 2.2 倍。包含否定的句法是主要的失败模式,某些模型即使在询问智能体是否不行动时,其认可行动的比例也高达 80-97%。这些模式与先前工作中记录的否定抑制失败一致,思维链推理在某些情况下降低了脆弱性,但并非所有情况。我们提供了按场景分层的风险画像,并提供了一个符合欧盟 AI 法案和 NIST RMF 要求的操作清单。代码、数据和场景将在发表后发布。

关键词

引用

@article{arxiv.2601.09724,
  title  = {Syntactic Framing Fragility: An Audit of Robustness in LLM Ethical Decisions},
  author = {Katherine Elkins and Jon Chun},
  journal= {arXiv preprint arXiv:2601.09724},
  year   = {2026}
}

备注

23 pages, 14 figures