中文

分段调和损失:以大模型处理类不平衡多标签临床数据用于医疗编码

计算与语言 2023-10-10 v1 人工智能

摘要

大语言模型(LLMs)的迅猛崛起与采用,以史上任何面向消费者技术中最快的应用速度打破了预期。医疗健康这一传统上使用 NLP 技术的领域,必然受到这一飞速发展的影响。在本文中,我们通过评估 LLMs 在真实噪声数据上医疗编码任务中的表现来衡量影响的程度。我们在 MIMIC III 和 IV 数据集上基于编码器类 LLMs(如 BERT)进行了若干实验。此外,我们提出了分段调和损失(Segmented Harmonic Loss),这是一种新的损失函数,通过一种新的分割算法对数据集中共现类别进行分段与解耦,以解决我们在多标签场景中发现普遍存在于大多数医疗数据中的极端类不平衡问题。我们还设计了一种基于嵌入相似性的技术来处理噪声数据。实验结果表明,当使用所提损失进行训练时,LLMs 即使在噪声长尾数据集上也能获得显著性能提升,其 F1 分数超越最先进水平(SOTA)逾十个百分点。

关键词

引用

@article{arxiv.2310.04595,
  title  = {Segmented Harmonic Loss: Handling Class-Imbalanced Multi-Label Clinical Data for Medical Coding with Large Language Models},
  author = {Surjya Ray and Pratik Mehta and Hongen Zhang and Ada Chaman and Jian Wang and Chung-Jen Ho and Michael Chiou and Tashfeen Suleman},
  journal= {arXiv preprint arXiv:2310.04595},
  year   = {2023}
}

备注

16 pages,3 figures, 3 tables