寻找最佳平衡点:推理时LLM反思中的质量、成本与速度权衡
机器学习
2025-10-24 v1 人工智能
机器学习
摘要
随着大型语言模型(LLM)的持续发展,实践者面临越来越多无需重新训练模型即可提升推理时性能的选项,包括预算调整和自反思等多步技术。虽然这些方法提高了输出质量,但它们也在准确性、成本和延迟之间引入了复杂的权衡,且这些权衡在不同领域中的理解尚不充分。本文系统比较了自反思和预算调整在数学推理与翻译任务中的表现。我们评估了包括Anthropic Claude、Amazon Nova和Mistral系列在内的主流LLM,以及其他模型在不同反思深度和计算预算下的表现,以推导出帕累托最优性能前沿。我们的分析揭示了自反思有效性存在显著的领域依赖性差异,在数学推理中性能提升高达220%。我们进一步研究了反思轮次深度和反馈机制质量对不同模型家族性能的影响。为了在实际环境中验证我们的发现,我们在Zalando的Lounge平台部署了一个自反思增强的营销内容本地化系统,该系统表现出市场依赖的有效性,强化了在部署这些技术时进行领域特定评估的重要性。我们的结果为在特定领域和资源约束下选择最优推理策略提供了可操作的指导。我们开源了自反思实现以供复现,地址为https://github.com/aws-samples/sample-genai-reflection-for-bedrock。
引用
@article{arxiv.2510.20653,
title = {Finding the Sweet Spot: Trading Quality, Cost, and Speed During Inference-Time LLM Reflection},
author = {Jack Butler and Nikita Kozodoi and Zainab Afolabi and Brian Tyacke and Gaiar Baimuratov},
journal= {arXiv preprint arXiv:2510.20653},
year = {2025}
}