基于信息论奖励的在线强化学习医学对话 AI 对齐
摘要
我们提出信息增益精调(Information Gain Fine-Tuning, IGFT),一种用于训练医学对话 AI 以进行有效患者访谈并生成完整病史(History of Present Illness, HPI)的新方法,无需预收集人类对话。IGFT 将在线组相对政策优化(Group Relative Policy Optimization, GRPO)与信息论奖励相结合,使模型能够通过与模拟患者的自生成对话学习。不同于依赖昂贵专家标注对话或静态数据集的现有方法,我们的在线强化学习框架允许模型通过探索发现有效的提问策略。我们的关键创新是信息增益奖励函数,跟踪对话中揭示的临床实体(如症状、时间模式和既往病史)的情况。每个提问的奖励基于其预期信息增益与 GPT-4o-mini 质量评估(包括临床相关性、患者参与度和具体性)相结合。这种混合方法确保模型学习提出有针对性、临床上恰当的问题,高效收集诊断信息。我们使用 LoRA 对两种模型进行微调:Llama-3.1-8B-Instruct 与 DeepSeek-R1-Distill-Qwen-7B(一个专注于推理优化的模型)。仅使用 Avey 数据中的简洁 HPI 进行训练,我们评估了其在 MIMIC 数据(更长、更详尽的 HPI)上的泛化能力。DeepSeek-R1-Distill-Qwen-7B(IGFT)在 Avey 上获得 0.408 的 F1 分数(相较于基线提升 10.9%),在 MIMIC 上获得 0.289(提升 12.9%),而 Llama-3.1-8B-Instruct(IGFT)分别达到 0.384 和 0.336。两种模型在 MIMIC 上均超越 OpenAI 的模型,还优于针对单轮医学问答优化的医学领域专属基线模型如 HuatuoGPT 与 UltraMedical。
引用
@article{arxiv.2601.17828,
title = {Aligning Medical Conversational AI through Online Reinforcement Learning with Information-Theoretic Rewards},
author = {Tanvi Verma and Yang Zhou and Rick Siow Mong Goh and Yong Liu},
journal= {arXiv preprint arXiv:2601.17828},
year = {2026}
}