中文

情境优于计算:人类在回环式链路思考提示中对面试答案质量的提升

计算与语言 2026-03-12 v1 人工智能

摘要

使用大语言模型进行行为面试评估存在独特挑战,需结构化评估、模拟真实面试官行为以及为候选人培训提供教育价值。我们探讨了链式思维(chain of thought)提示用于面试答案评估与改进,通过两个受控实验进行,涉及50个行为面试问题与答案。我们的贡献有三点:首先,我们在人类在回环式方法与自动链式思考改进之间提供了定量对比。采用组内配对设计(n=50),两种方法都显示出积极的评分提升。人类在回环式方法提供了显著的培训效益。置信度提升自3.16至4.16(p<0.001),真实性提升自2.94至4.53(p<0.001,Cohen\'s d=3.21)。人类在回环式方法还需要五分之一的迭代次数(1.0 vs 5.0,p<0.001),并实现了完整的人性化细节集成。其次,我们分析了收敛行为。两种方法都迅速收敛,平均迭代次数不足一,人类在回环式方法在最初较弱的答案中实现了100%成功率,而自动方法为84%(Cohen\'s h=0.82,大效应)。额外的迭代提供了最小的收益,表明主要限制是情境可用性而非计算资源。最后,我们提出一种基于消极偏差模型的对抗性挑战机制,命名为“bar raiser”,以模拟真实的面试官行为,尽管定量验证仍是未来工作。我们的发现表明,尽管链式思考提示为面试评估提供了有用的基础,但领域特定的增强和情境感知的方法选择对于实现真实且具有教育价值的结果至关重要。

关键词

引用

@article{arxiv.2603.09995,
  title  = {Context Over Compute Human-in-the-Loop Outperforms Iterative Chain-of-Thought Prompting in Interview Answer Quality},
  author = {Kewen Zhu and Zixi Liu and Yanjing Li},
  journal= {arXiv preprint arXiv:2603.09995},
  year   = {2026}
}