中文

面向成本感知序列决策的贝叶斯多 LLM 普能框架

人工智能 2026-01-06 v1 计算与语言 新兴技术

摘要

大型语言模型 (LLM) 正在越来越多地作为具有非对称错误成本情境下的自主决策代理部署,例如招聘(漏选人才 vs 浪费面试)、医疗分诊(漏选急诊 vs 不必要的升级)和欺诈检测(批准欺诈 vs 拒绝合法付款)。主流设计查询单个 LLM 对状态的后验分布,阈值“置信度”,并执行;我们证明这对具有成本的序列决策是不够的。我们提出一种贝叶斯、成本感知的多 LLM 普能框架,将 LLM 视为近似似然模型而非分类器。对于每个候选状态,我们通过对比提示获取似然值,利用鲁棒统计方法在 diverse models 之间聚合,并在明确的先验下根据新证据更新信念。这实现了连贯的信念更新、期望成本动作选择、基于价值信息的原则信息收集,以及通过集体偏差缓解实现公平性。在招聘简历筛选中,假设每漏选一位招聘成本为 40000 美元、每场面试成本为 2500 美元、每场电话筛选成本为 150 美元,针对 1000 份简历的实验使用五个 LLM (GPT-4o、Claude 4.5 Sonnet、Gemini Pro、Grok、DeepSeek) 将总成本降低 294000 美元(降低 34%),并将人口统计公平性提高 45%(最大群体差距从 22% 降至 5 个百分点)。消融实验将节省归因于多 LLM 聚合 51%、顺序更新 43% 和因不一致触发的信息收集 20%,这与正确概率基础的理论效益相一致。

关键词

引用

@article{arxiv.2601.01522,
  title  = {Bayesian Orchestration of Multi-LLM Agents for Cost-Aware Sequential Decision-Making},
  author = {Danial Amin},
  journal= {arXiv preprint arXiv:2601.01522},
  year   = {2026}
}