测试时基于反馈的推理学习
机器学习
2025-05-30 v2 人工智能
计算与语言
摘要
对于大型语言模型(LLM)来说,在一次尝试中解决复杂任务具有挑战性。需要与环境进行迭代交互并获取反馈才能成功,因此有效地利用反馈成为关键议题。现有方法要么在长度泛化方面受限,要么依赖盲目重试而未充分利用先前信息。本文引入 FTTT(Feedback at Test-Time,测试时反馈),将反馈利用形式化为测试时的优化问题。此外,我们提出了可学习的测试时优化器 OpTune,以有效利用反馈。在两个大型语言模型上通过四个推理数据集的实验表明,FTTT 和 OpTune 在可扩展性和性能方面均取得优异成绩。
引用
@article{arxiv.2502.15771,
title = {Learning to Reason from Feedback at Test-Time},
author = {Yanyang Li and Michael Lyu and Liwei Wang},
journal= {arXiv preprint arXiv:2502.15771},
year = {2025}
}
备注
ACL 2025 Main; Project Page: https://github.com/LaVi-Lab/FTTT