中文

测试时间计算的逆比例效应

人工智能 2025-12-17 v2 计算与语言

摘要

我们构建了评估任务,其中延长大规模推理模型(LRM)的推理长度会导致性能下降,呈现测试时间计算与准确率之间的逆比例关系。我们的评估任务涵盖四个类别:带干扰项的简单计数任务、带虚假特征的回归任务、带约束跟踪的演绎任务以及高级AI风险。我们识别出当模型进行更长推理时的五种不同失效模式:1) Claude模型因无关信息而越来越分心;2) OpenAI o系列模型抵御干扰项但对问题表述方式过拟合;3) 模型从合理的先验观念转变为虚假关联;4) 所有模型在维持复杂演绎任务注意力方面存在困难;5) 延长推理可能放大担忧行为,Claude Sonnet 4显示出增加的自我保护表现。这些发现表明,尽管测试时间计算比例扩大仍有望提高模型能力,但可能会无意中强化有问题的推理模式。我们的结果表明,跨越多样化推理长度评估模型的重要性,以识别并解决LRM中的这些失效模式。

关键词

引用

@article{arxiv.2507.14417,
  title  = {Inverse Scaling in Test-Time Compute},
  author = {Aryo Pradipta Gema and Alexander Hägele and Runjin Chen and Andy Arditi and Jacob Goldman-Wetzler and Kit Fraser-Taliente and Henry Sleight and Linda Petrini and Julian Michael and Beatrice Alex and Pasquale Minervini and Yanda Chen and Joe Benton and Ethan Perez},
  journal= {arXiv preprint arXiv:2507.14417},
  year   = {2025}
}

备注

Published in TMLR (12/2025; Featured Certification; J2C Certification), 78 pages