中文

基于多阶段检索-重排序模型的自动医学编码推荐

计算与语言 2024-05-30 v1 信息检索

摘要

国际疾病分类(ICD)是涵盖广泛疾病和病情的 definitive 医学分类系统。ICD 索引的主要目标是为医学记录分配 ICD 编码子集,从而促进各种健康状况的标准化文档和管理。大多数现有方法都受限于从极大 ICD 集合中选择合适的标签子集,且该集合具有重度长尾标签分布。在本文中,我们提出一种新解决方案,用于 ICD 索引,采用基于多阶段“检索-重排序”框架的方法,通过混合离散检索方法和对比学习进行重排序,以允许模型从简化的标签空间中进行更精确的预测。检索模型结合了电子健康记录(EHR)的辅助知识和离散检索方法(BM25),高效地收集高质量的候选标签。在最后一阶段,我们提出一种基于标签共现引导的对比学习重排序模型,通过拉近临床笔记与正面 ICD 编码之间的距离来对候选标签进行重排序。实验结果表明,所提出的方法在 MIMIC-III 数据集上在多个指标上实现了最先进的性能。

关键词

引用

@article{arxiv.2405.19093,
  title  = {Multi-stage Retrieve and Re-rank Model for Automatic Medical Coding Recommendation},
  author = {Xindi Wang and Robert E. Mercer and Frank Rudzicz},
  journal= {arXiv preprint arXiv:2405.19093},
  year   = {2024}
}

备注

Accepted to NAACL 2024 -- camera-ready version