何时筛选,何时跳过:资源有限情境下的 AI-人类工作流程中的 LLM 判官
最优化与控制
2026-03-17 v1
摘要
AI 系统可按规模生成输出,但大多数输出需在发布前获得人工批准。这导致瓶颈:人类无法跟上 AI 生成的产出量。自然的应对方案是在输出到达人类前插入 LLM 判官,对其进行筛选,从而过滤错误、放大有效审查能力。但判官并非完美。错误的否定会将正确输出送回不必要的返工;错误的接受则会消耗判官能力而未能缓解人类的负担。当应将输出路由通过判官,而当应将其直接路由至人工审查?我们将该工作流程建模为具有三个资源池的排队网络,并使用流动近似来刻画最优判官分配。分析揭示,最优分配关键取决于当前瓶颈所在:当审查员稀缺时,筛选可放大人类能力;但当工人已被拉得太满时,返工陷阱会挤占新生产。对于具有不同错误特征的异构任务类别,最优优先级可跨运营 regime 反转,具有互补错误结构的类别可混合,以实现 neither 类单独达到的的吞吐量。我们提出一种策略,采用流动最优分配比例进行路由,并采用流动最优服务水平进行准入控制,证明其在系统规模扩大时具有渐近最优性。扩展模型纳入人类反馈以改善返工质量,以及在预算约束下进行联合容量规划。数值实验确认快速收敜至流动最优解,表明该策略显著优于始终筛选或从不筛选的基准方法。
引用
@article{arxiv.2603.13870,
title = {When to Screen, When to Bypass: LLM-Judges in Resource-Scarce AI-Human Workflow},
author = {Ruihan Lin and Jiheng Zhang},
journal= {arXiv preprint arXiv:2603.13870},
year = {2026}
}