面向目标导向对话中高效信息寻求的反馈感知蒙特卡洌树搜索
人工智能
2025-06-03 v2 计算与语言
人机交互
机器学习
摘要
在对话系统中有效的决策和问题解决需要通过有针对性的提问来识别和获取缺失信息的能力。关键挑战在于通过提出能最大化信息增益的提问,有效缩小大量可能结果的范围。为此,我们提出了一种新框架,利用大型语言模型(LLM)生成信息寻求问题,并使用蒙特卡洌树搜索(MCTS)选择能最大化信息增益的提问,作为推理时间规划的一部分。我们的主要贡献包括一种分层反馈机制,利用过去的交互模式指导未来的策略。具体而言,将每个新问题映射到基于语义相似性的聚类中,而我们的 UCT(Upper Confidence bound for Trees)公式采用聚类特定的奖励加成,以优先选择针对类似问题已证明有效的成功问题轨迹。广泛的实证评估显示,我们的方法在医学诊断和技术故障排除领域平均实现了 12% 的成功率提升,并将对话中每次所需的 LLM 调用次数约降低 10 倍。当我们以受限的可能性集合开始时,平均还可实现约 8% 的成功率提升。我们的结果凸显了反馈感知 MCTS 在增强目标导向对话信息寻求方面的有效性。
引用
@article{arxiv.2501.15056,
title = {Feedback-Aware Monte Carlo Tree Search for Efficient Information Seeking in Goal-Oriented Conversations},
author = {Harshita Chopra and Chirag Shah},
journal= {arXiv preprint arXiv:2501.15056},
year = {2025}
}