ReZero:通过再尝试一次提升大语言模型搜索能力
计算与语言
2025-04-16 v1
摘要
检索增强生成(RAG)虽然改进了大型语言模型(LLM)在知识密集型任务上的性能,但对初始搜索查询质量依赖较大。当前方法通常使用强化学习(RL),聚焦于查询构建或对结果进行推理,却未明确鼓励在失败搜索后继续尝试。我们引入ReZero(Retry-Zero),一种新的RL框架,直接奖励在初始不成功尝试后重新搜索查询的行为。这激励LLM探索替代查询,而非提前停止。ReZero显著提升性能,准确率达46.88%,远高于25%的基线。通过奖励持久性,ReZero在初始查询可能不足的复杂信息寻求场景中增强了LLM的鲁棒性。
引用
@article{arxiv.2504.11001,
title = {ReZero: Enhancing LLM search ability by trying one-more-time},
author = {Alan Dao and Thinh Le},
journal= {arXiv preprint arXiv:2504.11001},
year = {2025}
}