面向 LLM 端点稳定性与身份的行为指纹
人工智能
2026-03-20 v1
摘要
AI 原生应用的一致性依赖于其驱动模型端点的行为一致性。传统可靠性指标,如 uptime、延迟和吞吐量,无法捕捉行为变化,而端点在权重、分词器、量化、推理引擎、内核、缓存、路由或硬件更新后,可能保持“健康”但有效模型身份发生变化。我们引入 Stability Monitor,一个黑盒稳定性监控系统,通过对固定提示集进行采样来获取输出分布的时间序列指纹。采用跨提示的能量距离统计量进行指纹比较,并使用置换检验 p 值作为分布迁移的证据,顺序聚合以检测变化事件并定义稳定期。在受控验证中,Stability Monitor 能检测模型家族、版本、推理堆栈、量化及行为参数的变更。在对同一模型由多个提供商托管的真实世界监控中,我们观察到显著的提供商间及同提供商内部的稳定性差异。
引用
@article{arxiv.2603.19022,
title = {Behavioral Fingerprints for LLM Endpoint Stability and Identity},
author = {Jonah Leshin and Manish Shah and Ian Timmis and Daniel Kang},
journal= {arXiv preprint arXiv:2603.19022},
year = {2026}
}
备注
4 pages, 1 figure, submitted to CAIS 2026 System Demonstrations