DPF-CM: 面向中文医疗 LLM 训练与部署的隐私保护向量数据库数据处理框架
机器学习
2025-09-03 v1 人工智能
摘要
当前中文医疗语言模型的开源训练流程主要侧重于优化训练方法以提升大语言模型 (LLMs) 的性能,但对训练数据处理的探索尚不充分。为弥补这一空白,我们提出了 DPF-CM,一个面向中文医疗 LLM 训练与部署的综合性数据处理框架。DPF-CM 包含两个核心模块。第一个模块是为模型训练量身定制的数据处理流水线。除标准数据处理操作外,我们 引入了一种链式示例上下文学习策略来生成面向问题的指令,以缓解指令内容的匮乏; 实现了一种基于集成的偏好数据筛选过滤机制,通过平均多个奖励模型来抑制噪声样本。第二个模块聚焦于模型部署期间的隐私保护。为防止训练数据意外暴露带来的隐私风险,我们提出了一种隐私保护向量数据库 (PPVD) 方法,该方法包含模型记忆搜索、高风险数据库构建、安全数据库构建以及匹配与替换四个关键阶段,以在推理过程中共同最小化隐私泄露。实验结果表明,DPF-CM 显著提升了模型准确率,使我们训练的中文医疗 LLM 在开源同类模型中达到了 SOTA 性能。此外,该框架将训练数据隐私泄露降低了 27%。
引用
@article{arxiv.2509.01354,
title = {DPF-CM: A Data Processing Framework with Privacy-Preserving Vector Databases for Chinese Medical LLMs Training and Deployment},
author = {Wei Huang and Anda Cheng and Zhao Zhang and Yinggui Wang},
journal= {arXiv preprint arXiv:2509.01354},
year = {2025}
}
备注
Accepted by EMNLP 2025