中文

即时安全PAC高效推理

人工智能 2026-02-02 v1

摘要

大规模推理模型(LRM)在复杂任务上表现卓越,但面临高计算成本和延迟问题。虽然选择性思考策略通过将容易查询路由到非思考模型来提高效率,但现有方法在在线设置下往往导致不可控错误,尤其是在性能损失仅部分观察且数据非平稳的情况下。为此,我们提出Betting Probably Approximately Correct(B-PAC)推理,这是一种原则化的方法,可实现部分反馈下的即时安全高效在线推理。具体而言,我们利用逆倾向评分估计器构建候选阈值的测试鞅,并基于累积的统计证据动态调整路由阈值以确保安全。理论上,我们建立了即时有效的性能损失控制和B-PAC推理的效率。大量实验表明,B-PAC推理显著降低了计算开销,通过将思考模型的使用次数降低最高可达81.01%,同时将性能损失控制在用户指定的水平以下。

关键词

引用

@article{arxiv.2601.22446,
  title  = {Anytime Safe PAC Efficient Reasoning},
  author = {Chengyao Yu and Hao Zeng and Youxin Zhu and Jianguo Huang and Huajun Zeng and Bingyi Jing},
  journal= {arXiv preprint arXiv:2601.22446},
  year   = {2026}
}