中文

试论合体式LLM陪审团:单调决策的运营特征

数据库 2026-02-24 v1 人工智能 计算与语言 软件工程

摘要

大型语言模型(LLM)已足够优秀,以至于开发人员可以用自然语言描述意图,让工具生成初始代码草案,这一工作流程正在被集成到GitHub Copilot、Cursor和Replit等工具中。然而,缺乏可靠的方法来判断哪些模型生成的查询是安全的,而无需将所有内容都发送给人类。我们研究了将LLM陪审团应用于运行此类审查步骤的可能性。我们首先在82个MySQL文本到SQL任务上对15个开放模型进行基准测试,采用执行导向的协议以获得哪些模型强大的干净基线。从这六个最佳模型中,我们构建了大小为1至6的单调陪审团,成员看到提示、模式和候选SQL,只有当每个成员都表示它是正确的时才接受。此规则匹配安全优先部署,其中错误接受的成本高于错误拒绝的成本。我们测量了真阳性率、假阳性率和Youden J指数,还我们也查看不同生成器的陪审团。我们的结果表明,单个模型陪审团不均匀,小型单调陪审团(由强大模型组成)可以在仍通过许多好查询的同时显着降低错误接受率,陪审团的确切组成性质具有显著影响。

关键词

引用

@article{arxiv.2602.18492,
  title  = {Vibe Coding on Trial: Operating Characteristics of Unanimous LLM Juries},
  author = {Muhammad Aziz Ullah and Abdul Serwadda},
  journal= {arXiv preprint arXiv:2602.18492},
  year   = {2026}
}

备注

Submitted to IEEE International Conference on Semantic Computing 2026