你得到的东西值得花费吗?对 LLM API 中模型替代的审计
计算与语言
2025-09-30 v2 密码学与安全
机器学习
摘要
商业大型语言模型(LLM)API 创造了一个根本性的信任问题:用户为特定模型支付费用,却没有任何保证供应商能忠实地交付它们。供应商可能在不被发现的情况下替换更便宜的替代方案(例如量化版本或更小的模型),以减少成本,同时维持广为人知的定价。我们形式化了此模型替代问题,并在现实中的对抗性条件下系统评估了检测方法。我们的实证分析揭示,软件-only 方法本质上不可靠:对文本输出进行统计检验需要大量查询,且在应对微妙替换时会失败,而使用对数概率的方法则被生产环境中固有的推理非确定性所击败。我们认为,这一验证缺口可以通过硬件级安全更有效地弥补。我们提出并评估了使用受信任执行环境(TEEs)作为一种实用且稳健的解决方案。我们的发现表明,TEEs 能提供可证明的密码学保障,仅带来适度的性能开销,为确保用户支付的东西如其所示提供了一条清晰可行的路径。代码已公开于 https://github.com/sunblaze-ucb/llm-api-audit
引用
@article{arxiv.2504.04715,
title = {Are You Getting What You Pay For? Auditing Model Substitution in LLM APIs},
author = {Will Cai and Tianneng Shi and Xuandong Zhao and Dawn Song},
journal= {arXiv preprint arXiv:2504.04715},
year = {2025}
}