中型Transformer模型在医疗记录处理中仍然相关吗?
信号处理
2025-02-28 v2
摘要
随着大型语言模型(LLM)成为许多自然语言处理应用的标准,我们探索了中型预训练Transformer模型作为医疗记录处理可行替代方案的潜力。医疗专业人员在患者入院期间生成的医疗记录由于复杂的医学术语、预训练模型解释数值数据的能力有限以及标注训练数据集的稀缺性而仍未得到充分利用。目标:本研究旨在利用CamemBERT-bio将医疗记录中提取的数值分类为七个不同的生理类别。先前的研究表明,基于Transformer的模型在此背景下可能不如传统自然语言处理方法。方法:为了提升CamemBERT-bio的性能,我们提出了两项关键创新:(1)引入关键词嵌入以优化模型的注意力机制;(2)采用数字无关策略,从文本中移除数值以鼓励基于上下文的学习。此外,我们通过验证数值是否落在既定标准范围内来评估提取数值的关键性。结果:我们的研究结果表明性能显著提升,CamemBERT-bio的F1分数达到0.89——比传统方法的0.73提高了20%以上,仅比GPT-4低0.06。这些结果是在使用小型且不平衡的训练数据集的情况下取得的。
引用
@article{arxiv.2404.10171,
title = {Are Medium-Sized Transformers Models still Relevant for Medical Records Processing?},
author = {Boammani Aser Lompo and Thanh-Dung Le and Philippe Jouvet and Rita Noumeir},
journal= {arXiv preprint arXiv:2404.10171},
year = {2025}
}
备注
Under revision