基于最优传输的测试时验证:覆盖率、收敛域与次优性
人工智能
2025-10-23 v1
摘要
尽管带有验证的测试时缩放在提升大语言模型(LLM)性能方面展现出潜力,但验证器的作用及其不完美性仍未被充分探索。验证的效果通过三个量的交互来体现: 生成器的覆盖率, 验证器的收敛域(ROC),以及 采样算法的次优性。尽管近期的研究捕捉了这些因子的子集,但仍缺乏一个量化其交互几何关系的统一框架。我们将可验证的测试时缩放构建为一个传输问题。这刻画了覆盖率、ROC 与次优性之间的交互,并揭示了次优性-覆盖率曲线表现出三种机制:传输机制——次优性随覆盖率增加而增加;策略改进机制——次优性可能随覆盖率增加而降低,具体取决于验证器的 ROC;饱和机制——次优性趋于平稳,不受覆盖率影响。我们进一步提出并分析了两类采样算法——顺序采样与批量采样,并考察了它们的计算复杂度如何影响这些权衡。基于 Qwen、Llama 和 Gemma 模型的实证结果证实了我们的理论发现。
引用
@article{arxiv.2510.18982,
title = {Test-time Verification via Optimal Transport: Coverage, ROC, & Sub-optimality},
author = {Arpan Mukherjee and Marcello Bullo and Debabrota Basu and Deniz Gündüz},
journal= {arXiv preprint arXiv:2510.18982},
year = {2025}
}