中文

评估多轮 LLM 系统中模型切换后的性能漂移

计算与语言 2026-03-04 v1

摘要

部署的多轮 LLM 系统定期因模型升级、跨提供商路由和备份机制而在交互过程中切换模型。此类切换会导致上下文不匹配:后续轮次生成的模型必须以由不同模型撰写的对话前缀为条件,可能引发隐式的性能漂移。我们引入一个 switch-matrix 基准测试,通过对早期轮次运行前缀模型、对最终轮次运行后缀模型,并使用配对的 episode 级别自助置信区间与无切换基准进行比较来衡量此效应。在 CoQA 对话式问答和 Multi-IF 基准测试中,即使进行单轮切换,也会导致普遍且具有统计显著性的方向性效应,可能使 Multi-IF 严格成功率在 -8% 到 +13% 之间波动,在 CoQA 上产生 +/- 4 的绝对 F1 分数变化,这相当于常见模型tier(如 GPT-5-nano 与 GPT-5-mini)之间的无切换差距。我们进一步发现系统性的兼容性模式:某些后缀模型几乎在任何非自身对话历史下都会退化,而另一些后缀模型几乎在任何外部前缀下都能提升。为实现压缩的切换风险监控,我们将切换引起的漂移分解为每个模型的前缀影响项和后缀易受性项,能够解释基准测试中约70%的方差。这些结果将切换鲁棒性定位为单模型基准测试所忽略的操作可靠性维度,动机化ulis明确的监控和针对性缓解措施在多轮系统中。

关键词

引用

@article{arxiv.2603.03111,
  title  = {Evaluating Performance Drift from Model Switching in Multi-Turn LLM Systems},
  author = {Raad Khraishi and Iman Zafar and Katie Myles and Greig A Cowan},
  journal= {arXiv preprint arXiv:2603.03111},
  year   = {2026}
}