中文

快速失败或询问:通过人类在环系统工程缓解推理大语言模型的缺陷

人工智能 2025-07-22 v1 机器学习 系统与控制 系统与控制

摘要

最先进的推理大语言模型是强大的问题解决者,但仍偶尔会出错。然而,在风险敏感领域采用人工智能模型通常需要接近零的错误率。为弥合这一差距,我们提出了推理模型与人类专家之间的合作,后者解决模型无法自信回答的查询。我们发现,通过推理痕迹长度对推理模型不确定性进行量化,可有效地依据 deferral 人类,例如在 difficult MATH 题目中,将 Qwen3 235B-A22B 的错误率从 3% 降至不到 1% 时,仅 deferral 7.5% 的查询。然而,推理模型的高延迟仍使其在高查询量的用例中难以部署。为应对这一挑战,我们探索了以大型非推理模型前端包装推理模型。我们称这种修改后的人类在环系统为“Fail Fast, or Ask”,因为非推理模型可直接将 difficult 查询 deferral 给人类专家(“快速失败”),而无需支付推理模型的更高延迟。我们展示了该方法可实现约 40% 的延迟降低和约 50% 的成本节省,同时保持 90% 以上的准确率-拒率曲线下面积。然而,我们观察到延迟节省低于预期,因为存在“延迟 drag”现象:使用非推理模型处理 easier 查询会将推理模型的延迟分布推向更长的延迟。总体而言,我们的结果表明,最先进的推理模型的缺陷——非平凡的错误率和高延迟——可以通过黑箱系统工程大幅缓解,无需访问 LLM 的内部结构。

关键词

引用

@article{arxiv.2507.14406,
  title  = {Fail Fast, or Ask: Mitigating the Deficiencies of Reasoning LLMs with Human-in-the-Loop Systems Engineering},
  author = {Michael J. Zellinger and Matt Thomson},
  journal= {arXiv preprint arXiv:2507.14406},
  year   = {2025}
}

备注

8 pages, 5 figures