BitCal-TTS:面向量化推理模型的位校准测试时间扩展
人工智能
2026-05-08 v1
摘要
后训练量化在紧张的内存和延迟预算下使大型推理模型实用,但会扭曲驱动自适应测试时间计算分配的在线信号。在固定新生成 token 数量上限的情况下,误校准的置信度可能导致有害的提前停止:模型可能表面上呈现一个合理的最终 line,但底层推理仍然错误,或者控制器会在轨迹未稳定时就停止。我们研究了这种互动,针对贪心 4 位推理提出了 BitCal-TTS,一种轻量级运行时控制器,组合 (i) 用于 token 级别不确定性和推理轨迹稳定性的低成本在线代理,(ii) 在低名义精度时保守的位条件置信度重新缩放,以及 (iii) 为 GSM8K 风格结构化输出设计的位感知后标记确认时域。该方法无需对基础模型进行微调,可集成到标准的 Hugging Face 4 位推理中,使用前向钩子获取 logits 和最后一层隐藏状态。在 Qwen2.5 Instruct 模型的小规模评估片段上,BitCal-TTS 在 7B 和 14B 规模下均优于非位感知自适应基线,提高了 exact-match 准确率,同时保持了相当大的 token 节省。
引用
@article{arxiv.2605.05561,
title = {BitCal-TTS: Bit-Calibrated Test-Time Scaling for Quantized Reasoning Models},
author = {Sai Babu Patarlapalli and Surya Teja Avvaru},
journal= {arXiv preprint arXiv:2605.05561},
year = {2026}
}
备注
17 pages, 5 figures, 4 tables. Code and reproducibility materials at https://github.com/Saibabu7770/bitcal-tts