KDH-MLTC:面向医疗多标签文本分类的知识蒸馏
计算与语言
2025-05-13 v1
摘要
医疗文本数据的不断增加需要计算效率高且准确率高的分类方法,才能处理医学术语的细微和复杂本质。本研究提出了面向医疗多标签文本分类的知识蒸馏框架(KDH-MLTC),该框架利用模型压缩和大型语言模型(LLM)。该方法通过集成知识蒸馏和顺序微调,随后通过粒子群优化(PSO)进行超参数调优。KDH-MLTC 通过顺序训练将知识从较复杂的教师 LLM(即 BERT)传递到较轻量的学生 LLM(即 DistilBERT),该训练方式适用于 MLTC,既保留教师所学习信息,又大幅降低计算需求。因此,该分类可以在本地完成,适用于医疗文本数据,这类数据具有敏感性,从而确保符合 HIPAA 合规要求。在来自 HoC 数据集的三个不同规模的医学文献数据集上进行的实验表明,KDH-MLTC 在各类现有方法中表现优异,特别是在最大数据集上达到 82.70% 的 F1 分数。此外,还进行了统计验证和消融研究,证明了 KDH-MLTC 的稳健性。此外,PSO 基于的超参数优化过程允许识别最佳配置。该方法为医疗文本分类研究做出了贡献,在资源受限的医疗环境中实现了效率需求与满意的准确率需求之间的平衡。
关键词
引用
@article{arxiv.2505.07162,
title = {KDH-MLTC: Knowledge Distillation for Healthcare Multi-Label Text Classification},
author = {Hajar Sakai and Sarah S. Lam},
journal= {arXiv preprint arXiv:2505.07162},
year = {2025}
}