多轮LLM推理的自适应停止
计算与语言
2026-04-07 v2 人工智能
摘要
大语言模型(LLM)越来越多地依赖多轮推理和交互,例如自适应检索增强生成(RAG)和ReAct风格智能体,来回答困难问题。这些方法通过迭代检索信息、推理或行动来提高准确性,但引入了一个关键挑战:模型何时应停止?现有方法依赖启发式停止规则或固定轮次预算,无法提供最终预测仍包含正确答案的形式化保证。这一限制在金融和医疗等高风险领域尤为突出,不必要的轮次增加成本和延迟,而过早停止则可能导致错误决策。conformal prediction (CP)提供形式化覆盖保证,但现有的LLM-CP方法仅适用于单一模型输出,无法处理具有自适应停止的多轮流水线。为填补这一空白,我们提出了多轮语言模型与共形预测(MiCP),首个用于多轮推理的CP框架。MiCP在不同轮次间分配不同的错误预算,使模型能够提前停止,同时保持整体覆盖保证。我们在自适应RAG和ReAct上展示了MiCP,在单跳和多跳问答基准上均达到目标覆盖,同时减少了轮次数量、推理成本和预测集大小。我们进一步引入了一种联合评估覆盖有效性和回答效率的新指标。
引用
@article{arxiv.2604.01413,
title = {Adaptive Stopping for Multi-Turn LLM Reasoning},
author = {Xiaofan Zhou and Huy Nguyen and Bo Yu and Chenxi Liu and Lu Cheng},
journal= {arXiv preprint arXiv:2604.01413},
year = {2026}
}