中文

自动化 ICD 精神诊断分类:从经典自然语言处理到大语言模型

计算与语言 2026-05-21 v1 人工智能 机器学习

摘要

精神健康已成为全球优先级,导致临床诊断编码工作负担巨大。本研究提出通过将自由文本描述映射到国际疾病分类(ICD)来自动化精神诊断分析,采用自然语言处理(NLP)和机器学习(ML)技术。利用包含 145,513 条西班牙语精神诊断描述的专用数据集,评估了各种文本表示方法,从经典基于频率的模型(BoW、TF-IDF)到最先进的大语言模型(LLM)如 e5_large、BioLORD 和 Llama-3-8B。结果表明,基于 Transformer 的嵌入方法在捕捉隐式语义线索和细微医学术语方面始终优于传统方法。通过端到端微调,e5_large 模型取得最高性能,F1_micro 分数为 0.866。本研究表明,针对特定临床术语的 LLM 适配对于克服“长尾”标签分布和精神话语内在模糊性挑战至关重要。

关键词

引用

@article{arxiv.2605.21154,
  title  = {Automated ICD Classification of Psychiatric Diagnoses: From Classical NLP to Large Language Models},
  author = {Fernando Ortega and Raúl Lara-Cabrera and Jorge Dueñas-Lerín and Alejandro de la Torre-Luque and Mercé Salvador Robert and Enrique Baca-García},
  journal= {arXiv preprint arXiv:2605.21154},
  year   = {2026}
}