面向低资源语言的隐私保护临床信息提取小型语言模型研究
计算与语言
2026-02-26 v1 人工智能
机器学习
摘要
从医学转录记录中提取低资源语言中的临床信息是医疗 NLP 领域面临的重大挑战之一。本研究评估了一个由 Aya-expanse-8B 作为波斯语到英语翻译模型,结合五个开源小型语言模型(Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Llama-3.2-3B-Instruct、Qwen2.5-1.5B-Instruct 和 Gemma-3-1B-it)构建的两步管道,用于从 1,221 份来自癌症姑娘护理热线中心匿名化的波斯语转录记录中进行二分类提取 13 项临床特征。采用无需微调的 few-shot 提示策略,对模型在宏平均 F1 分数、 Matthews 相关系数 (MCC)、灵敏度和特异度方面进行评估,以考虑类别不平衡问题。Qwen2.5-7B-Instruct 实现了最佳整体性能(中位数宏 F1: 0.899;MCC: 0.797),而 Gemma-3-1B-it 显示最弱的效果。较大的模型(7B--8B 参数)在灵敏度和 MCC 上 consistently 优于较小的模型。对 Aya-expanse-8B 的双语分析表明,将波斯语转录记录翻译为英语后,灵敏度得到提升,缺失输出减少,抗类别不平衡的指标得到增强,尽管特异度和精确度略有下降。特征层面的结果显示,多数模型在提取生理症状方面表现可靠,而心理抱怨、行政请求以及复杂躯体特征仍具有挑战性。这些发现为在资源有限、缺乏标注资源的多语言临床 NLP 环境中部署开源小型语言模型提供了实用且隐私保护的方案,强调在敏感医疗应用中需同时优化模型规模和输入语言策略的重要性。
引用
@article{arxiv.2602.21374,
title = {Small Language Models for Privacy-Preserving Clinical Information Extraction in Low-Resource Languages},
author = {Mohammadreza Ghaffarzadeh-Esfahani and Nahid Yousefian and Ebrahim Heidari-Farsani and Ali Akbar Omidvarian and Sepehr Ghahraei and Atena Farangi and AmirBahador Boroumand},
journal= {arXiv preprint arXiv:2602.21374},
year = {2026}
}
备注
16 pages, 3 figures, 2 supplementary files