任务不可行:反馈引导的动态交互式规划提升 LLM 推理能力
计算与语言
2025-10-14 v1 人工智能
摘要
近期语言智能体的进展在多跳推理任务方面取得了显著进展。然而,现有方法往往难以处理需要大量信息检索的开放域问题,因其依赖固定的动作序列。为此,我们提出反馈引导的动态交互式规划 (FGDIP) 框架,以增强 LLM 在开放域多跳推理任务中的推理能力。该框架首先识别问题相关的关键实体,作为推理过程的初始节点。随后,从这些初始节点生成推理子节点,through a combination of historical error analysis and real-time feedback,该框架能够动态调整和优化推理策略。通过将深度优先搜索与一种创新的节点生成技术集成,框架基于先前的错误路径和同一层级并行生成的节点进行动态调整。这种动态策略有效扩大了搜索空间,同时确保推理过程系统性地收敛于准确解。实验结果表明,FGDIP 在 HotpotQA 数据集上达到最高 54.47% 的 F1 分数,在 StrategyQA 数据集上达到 70.05%,分别超过最佳基线模型 5.03% 和 7.25%,凸显其在多跳推理任务中的通用性和潜力。
引用
@article{arxiv.2510.05577,
title = {Mission Impossible: Feedback-Guided Dynamic Interactive Planning for Improving Reasoning on LLMs},
author = {Dong Yan and Gaochen Wu and Bowen Zhou},
journal= {arXiv preprint arXiv:2510.05577},
year = {2025}
}