PrivMedChat:面向医疗对话系统的端到端差分隐私 RLHF
计算与语言
2026-03-10 v2
摘要
大型语言模型日益用于患者面向医疗援助和临床决策支持,但将其适用于临床对话往往需要来自医生-患者对话中派生的监督信号,而这些对话可能包含敏感信息。传统的监督式微调和基于人类反馈的强化学习(RLHF)可能放大记忆效应,导致成员推理和稀有训练集细节的泄露。我们提出 PrivMedChat(Private Medical Chat),一个面向医疗对话系统的端到端差分隐私 RLHF(DP-RLHF)框架。我们的 метод将差分隐私在每个访问对话派生监督的训练阶段得到 enforcement,结合 DP-SGD 实现监督式微调和来自偏好对的奖励模型学习,并采用差分隐私感知的策略优化进行对齐。为避免昂贵的医师标注,我们引入一种无标注的偏好构建策略,将医生响应与经过滤波后的非专家生成组合起来。我们在医疗对话任务上评估 PrivMedChat,并在持续的隐私账核下评估其效用、安全性与隐私,从而为在提供正式隐私保证的同时对齐医疗聊天机器人提供了实际可行的路径。我们已在 https://github.com/sudip-bhujel/privmedchat 上开源代码。
引用
@article{arxiv.2603.03054,
title = {PrivMedChat: End-to-End Differentially Private RLHF for Medical Dialogue Systems},
author = {Sudip Bhujel},
journal= {arXiv preprint arXiv:2603.03054},
year = {2026}
}
备注
13 pages, 3 figures