中文

对话森林:分支结构是微调大型语言模型进行多回合医疗对话的关键

计算与语言 2025-07-16 v2 人工智能

摘要

直接偏好优化(DPO)和群相对策略优化(GRPO)等微调方法在训练大型语言模型(LLM)处理单轮任务方面取得了成功。然而,这些方法在多轮应用中存在不足,例如诊断性问诊场景中,需要理解早期对话轮次如何影响后续完成情况和结果。在医疗领域,多轮视角对于学习诊断模式和更好地理解对话动态至关重要。为填补这一差距,我引入了 Savage Conversation Forests(SCF),这是一种利用分支对话架构进行微调 LLM 以实现多轮对话的强化学习框架。SCF 在每个对话轮次生成多个可能的对话延续,从而使模型能够学习不同早期响应如何影响后续互动和诊断结果。在模拟的医生-患者对话实验中,SCF 的分支架构在诊断准确率方面优于线性对话架构。我假设 SCF 的改进源于其为对话各轮次提供更丰富、相互关联的训练信号。这些结果表明,分支训练架构是实现大型语言模型在复杂多轮对话任务中微调的重要策略。

关键词

引用

@article{arxiv.2507.04099,
  title  = {Conversation Forests: The Key to Fine Tuning Large Language Models for Multi-Turn Medical Conversations is Branching},
  author = {Thomas Savage},
  journal= {arXiv preprint arXiv:2507.04099},
  year   = {2025}
}