提示复杂度稀释结构化推理:关于洗车问题的后续研究
人工智能
2026-03-17 v1
摘要
在之前的研究[Jo, 2026]中,STAR 推理(情境-任务-行动-结果)将洗车问题准确率从 0% 提升至 Claude Sonnet 4.5 的 85%,并通过额外的提示层提升至 100%。本后续研究询问:STAR 在生产系统提示中是否仍有效?我们测试了 STAR 嵌入 InterviewMate 60+ 行生产提示中,该提示经历了迭代式添加的风格指南、格式指令和轮廓特征。三种条件,每种 20 次试验,分别在 Claude Sonnet 4.6 上测试:(A) 带 Anthropic 轮廓的生产提示,(B) 带默认轮廓的生产提示,(C) 仅含 STAR 的原始提示。C 得分 100%(在 n=100 时验证)。A 和 B 分别得分 0% 和 30%。提示复杂度稀释了结构化推理。STAR 在孤立环境中可达 100%,但在复杂提示环境中降至 0-30%。其机制:诸如“以具体事实开头”之类的指令迫使先结论后推理的输出顺序,颠倒了 STAR 有效性得益于 reason-then-conclude 顺序的逻辑。在一次案例中,模型输出“短答案:走。”后又执行正确识别约束的 STAR 推理——证明模型能够正确推理,但已针对错误答案提前下结论。跨模型比较显示,STAR-only 提升从 85% (Sonnet 4.5) 到 100% (Sonnet 4.6),而无需更改提示,表明模型升级放大了孤立环境中的结构化推理效果。这些结果表明,结构化推理框架不能简单假设从孤立测试传递到复杂提示环境。模型推理与结论的顺序是一个首要的设计变量。
引用
@article{arxiv.2603.13351,
title = {Prompt Complexity Dilutes Structured Reasoning: A Follow-Up Study on the Car Wash Problem},
author = {Heejin Jo},
journal= {arXiv preprint arXiv:2603.13351},
year = {2026}
}
备注
"Follow-up to arXiv:2602.21814"