中文

通过微调 DRAGON Longformer 模型提升临床文本分类

计算与语言 2025-07-15 v1 人工智能

摘要

本研究探索了优化 DRAGON Longformer 基础模型以进行临床文本分类的可能性,具体针对医学案例描述的二分类。使用包含500个临床病例的数据集,其中包含结构化医学观察数据,400个用于训练,100个用于验证。对预训练的 joeranbosma/dragon-longformer-base-mixed-domain 模型进行了增强,包括微调超参数、领域特定预处理和架构调整。关键修改包括将序列长度从512个标记扩展到1024个标记,将学习率从1e-05调整为5e-06,将训练周期从5个扩展到8个,并包含专门的医学术语。优化后的模型实现了显著的性能提升:准确率从72.0%提高到85.2%,精确率从68.0%提高到84.1%,召回率从75.0%提高到86.3%,F1分数从71.0%提高到85.2%。统计分析确认了这些改进的显著性(p < .001)。该模型显示出对医学术语、解剖测量值和临床观察的解释能力得到了增强。这为领域特定语言模型研究做出了贡献,并为临床自然语言处理应用提供了实际意义。优化模型在多种医学条件下的强性能表现凸显了其在医疗保健环境中广泛应用的潜力。

关键词

引用

@article{arxiv.2507.09470,
  title  = {Enhancing Clinical Text Classification via Fine-Tuned DRAGON Longformer Models},
  author = {Mingchuan Yang and Ziyuan Huang},
  journal= {arXiv preprint arXiv:2507.09470},
  year   = {2025}
}

备注

29 pages, 5 tables