中文

MHLAT:用于自动 ICD 编码的多跳标签级注意力模型

计算与语言 2023-09-19 v1 人工智能

摘要

国际疾病分类(ICD)编码是将 ICD 诊断代码分配给临床笔记的任务。鉴于标签数量庞大(近 9,000 个)且文本冗长(最多 8,000 个 token),该任务颇具挑战。然而,与先前工作的单次阅读过程不同,人类倾向于反复阅读文本与标签定义以获得更确信的答案。此外,尽管预训练语言模型已被用于解决这些问题,但它们受困于巨大的内存占用。为解决上述问题,我们提出一个简单而有效的模型,称为多跳标签级注意力(Multi-Hop Label-wise ATtention, MHLAT),其中部署多跳标签级注意力以获取更精确且更具信息量的表示。在三个基准 MIMIC 数据集上的大量实验表明,我们的方法在所有七项指标上取得了显著更优或具竞争力的性能,且需优化的参数少得多。

关键词

引用

@article{arxiv.2309.08868,
  title  = {MHLAT: Multi-hop Label-wise Attention Model for Automatic ICD Coding},
  author = {Junwen Duan and Han Jiang and Ying Yu},
  journal= {arXiv preprint arXiv:2309.08868},
  year   = {2023}
}

备注

5 pages, 1 figure, accepted in ICASSP 2023