中文

ATPO:面向多轮医疗对话的自适应树形策略优化

机器学习 2026-03-04 v1 人工智能

摘要

在多轮医疗对话中有效信息寻求对于准确诊断至关重要,尤其是当面临信息不完整时。为这些交互场景对大语言模型(LLM)进行对齐具有挑战性,因为用户-代理交互中存在不确定性,我们将其形式化为层次化马尔可夫决策过程(H-MDP)。尽管常规强化学习方法如群体相对策略优化(GRPO)在长期信用分配方面困难,近端策略优化(PPO)在此上下文中 suffers from 不稳定的值估计,我们提出了 novel 不确定性感知的自适应树形策略优化(ATPO)算法。该方法自适应分配 rollout 预算给高不确定性状态,由 Bellman 误差和动作价方差的复合度量量化。这一策略实现更准确的值估计,同时促进更高效和更具多样性的探索。为缓解基于树形RL的高计算成本,我们引入两个关键优化:基于不确定性引导的修剪机制以最小化 rollout 数量,以及利用 KV 缓存复用的异步搜索架构以最大化推理吞吐量。在三个公开医疗对话基准上的大量实验表明,我们的方法显著优于多个强大基线,最终 Qwen3-8B 模型超越了规模更大的 GPT-4o (+0.92%准确率)。

关键词

引用

@article{arxiv.2603.02216,
  title  = {ATPO: Adaptive Tree Policy Optimization for Multi-Turn Medical Dialogue},
  author = {Ruike Cao and Shaojie Bai and Fugen Yao and Liang Dong and Jian Xu and Li Xiao},
  journal= {arXiv preprint arXiv:2603.02216},
  year   = {2026}
}

备注

Accepted to ICLR 2026