中文

FEval-TTC:面向测试时间计算的公平评估协议

机器学习 2025-11-04 v1 计算与语言

摘要

大语言模型(LLMs)的性能以及与API调用相关的美元成本可能会随时间波动,从而可能使先前研究中的结论失效。为此,我们提出面向测试时间计算的公平评估协议(FEval-TTC),旨在确保对测试时间计算(TTC)方法进行一致评估,而不受此类波动的影响。FEval-TTC聚焦于评估利用底层思考链(CoT)的TTC方法,支持在多种LLM上进行多样化的数学和常识推理数据集上的评估。标准化了few-shot提示和答案提取过程,减少了研究者的时间和金钱开销。此外,我们提供一种成本建模程序,用于估算每个查询的记号和美元成本,以便公平比较各种TTC方法。我们开源FEval-TTC供公众使用,网址为https://github.com/networkslab/feval_ttc

关键词

引用

@article{arxiv.2511.01203,
  title  = {FEval-TTC: Fair Evaluation Protocol for Test-Time Compute},
  author = {Pavel Rumiantsev and Soumyasundar Pal and Yingxue Zhang and Mark Coates},
  journal= {arXiv preprint arXiv:2511.01203},
  year   = {2025}
}