中文

价格反转现象:当更便宜的推理模型实际成本更高时

计算与语言 2026-05-29 v2 人工智能 计算机科学与博弈论 机器学习 多智能体系统

摘要

开发者和消费者越来越倾向于根据其列出的 API 价格来选择推理模型(RM)。然而,这些价格是否准确反映实际的推理成本?我们进行了首次系统性研究,评估了 8 个前沿推理模型,涵盖 12 个多样化任务,包括竞赛数学、科学 QA、代码生成和多域智能体。我们发现定价反转现象:在 32% 的模型对比较中,标价更低的模型实际成本更高,反转幅度可达 28 倍。例如,Gemini 3 Flash 的标价比 GPT-5.4 便宜 80%,但其在所有任务中的实际成本却高出 38%。我们构建了一个基于Shapley价值的正式成本归因框架,并利用它追踪思考token消耗和交互次数巨大差异的主导因素:在相同的查询上,一个模型可能比另一个模型多使用 900% 的思考token,或多 10 倍的环境交互次数。我们进一步表明,单次查询成本预测本质上很难实现:相同查询的重复运行结果,思考token变异可达 9.7 倍,为任何预测器设立了不可约的噪声底线。因此,我们提出将成本分布预测作为一个开放挑战。我们的发现表明,列出的API定价是实际成本不可靠的代理,迫使人们进行成本感知的模型选择,并要求透明的每请求成本监控。

关键词

引用

@article{arxiv.2603.23971,
  title  = {The Price Reversal Phenomenon: When Cheaper Reasoning Models Cost More},
  author = {Lingjiao Chen and Chi Zhang and Yeye He and Ion Stoica and Matei Zaharia and James Zou},
  journal= {arXiv preprint arXiv:2603.23971},
  year   = {2026}
}