EdgeJury:面向Serverless Edge推理的跨审阅小模型集成框架
机器学习
2026-01-06 v1
摘要
幻觉现象阻碍了可靠的问答系统,尤其是在资源受限的部署场景中,前沿级大模型或检索管道可能难以实际应用。我们提出EdgeJury,一个轻量级集成框架,仅使用3B-8B规模的指令微调语言模型即可提升事实性和鲁棒性,适用于Serverless边缘推理。EdgeJury包含四个阶段:(1) 并行角色专化生成,(2) 匿名化跨审阅,包含结构化批判与排序,(3) 主席综合,将最强内容整合并解决被标记问题,(4) 基于模型间一致性的主张级别一致性标记。在TruthfulQA(MC1)测试中,EdgeJury达到76.2%的准确率(95%置信区间:72.8-79.6%),相较于单一8B基线模型的62.8%提升了21.4%,并在透明计算开销报告下超越了包括自洽性和多数投票在内的标准基线(报告总token数和平台成本)。在包含200个对抗性问题的EdgeCases测试集上,EdgeJury实现了+48.2%的相对提升(95%置信区间:44.0-52.4%)。对100个错误答案的手动分析显示,与单模型基线相比,事实性幻觉错误约减少55%。在Cloudflare Workers AI上部署的EdgeJury实现了8.4秒的中位数端到端延迟,证明了在不依赖外部检索或专有大模型API的情况下,协调式小模型集成可在误导性QA基准中提升事实性。
引用
@article{arxiv.2601.00850,
title = {EdgeJury: Cross-Reviewed Small-Model Ensembles for Truthful Question Answering on Serverless Edge Inference},
author = {Aayush Kumar},
journal= {arXiv preprint arXiv:2601.00850},
year = {2026}
}
备注
24 pages,3 Figures, Submitting to IEEE Access