面向医学录音与记录生成的设备内人工智能模型:在隐私与可及性之间降低成本
计算与语言
2025-07-08 v1 人工智能
摘要
背景:临床文档是医护人员的重大负担,医生每天可花费两小时用于行政任务。近期大型语言模型(LLM)的进展为医疗领域提供了有前景的解决方案,但隐私顾虑和计算需求限制了其在医疗环境中的采纳。目标:开发并评估一种面向医学录音的隐私保护、设备内医学录音系统,使用经微调的 Llama 3.2 1B 模型,能够在浏览器中完全实现数据主权,生成结构化医学记录。方法:我们使用参数高效微调(PEFT)结合 LoRA 在 1,500 组人工合成的医学录音到结构化记录的配对样本上对 Llama 3.2 1B 模型进行微调。该模型在两个数据集上进行评估:100 例内分泌科录音和140 例修改版 ACI 基准案例。评估采用统计指标(ROUGE、BERTScore、BLEURT)以及 LLM 作为评判员的评估,覆盖多个临床质量维度。结果:经微调的 OnDevice 模型在基准模型上展现出显著改进。在 ACI 基准测试中,ROUGE-1 分数从 0.346 提升至 0.496,而 BERTScore F1 从 0.832 提升至 0.866。临床质量评估显示,重大幻觉案例减少(从 85 例降至 35 例),事实正确性提升(从 2.81 提升至 3.54,满分 5 分)。在内部评估数据集上也观察到类似改进,综合得分从 3.13 提升至 4.43(提升 41.5%)。结论:针对医学录音进行微调紧凑型 LLM 可实现临床意义的改进,同时实现浏览器端完整部署。该方法解决了AI在医疗领域采纳的关键障碍:隐私保护、成本降低和资源受限环境下的可及性。
引用
@article{arxiv.2507.03033,
title = {Preserving Privacy, Increasing Accessibility, and Reducing Cost: An On-Device Artificial Intelligence Model for Medical Transcription and Note Generation},
author = {Johnson Thomas and Ayush Mudgal and Wendao Liu and Nisten Tahiraj and Zeeshaan Mohammed and Dhruv Diddi},
journal= {arXiv preprint arXiv:2507.03033},
year = {2025}
}