多智能体智能辅导系统的时延与成本:规模化部署中的绩效分析
计算机与社会
2026-04-28 v1 人工智能
分布式、并行与集群计算
机器学习
摘要
多智能体大语言模型辅导系统通过智能体专业化提升响应质量,但每次学生查询会触发多个并发 API 调用,其时延通过并行阶段的最大效应叠加,单智能体系统则不面临此问题。我们对构建于 Gemini 2.5 Flash 和 Google Vertex AI 上的四智能体辅导系统 ITAS,进行了横跨三个吞吐量等级(Standard PayGo、Priority PayGo 和 Provisioned Throughput)以及最高 50 个并发用户的十一个并发水平的仪表化测试,产生了超过 3000 个请求,来自实际部署于研究生 STEM 课程的线上系统。Priority PayGo 在完整负载范围内保持亚 4 秒的响应时延;Standard PayGo 在教室规模的并发负载下性能显著下降;Provisioned Throughput 在低并发时实现最低时延,但在约 20 个并发用户以上时其预留容量即被耗尽。成本分析显示,两款按令计费的服务在最坏情况使用上限下,均低于学生每学期一本 STEM 教科书的价格;而 Provisioned Throughput 在持续预留资源的情况下成本较高,但对于能够预测并将流量集中到高利用率的机构而言,成本竞争力更强。本研究为从单个小班到全校范围的部署提供了明确的服务等级选择指导。
引用
@article{arxiv.2604.24110,
title = {Latency and Cost of Multi-Agent Intelligent Tutoring at Scale},
author = {Iizalaarab Elhaimeur and Nikos Chrisochoides},
journal= {arXiv preprint arXiv:2604.24110},
year = {2026}
}
备注
11 pages, 5 figures, 5 tables. Companion papers: arXiv:Q-ID (Quantum deployment), arXiv:A-ID (Architecture)