中文

ALIGN:用于医学编码的组合式大语言模型系统

机器学习 2025-03-14 v2

摘要

历史性临床试验数据的复用具有显著的潜力,以加速医学研究和药物开发。然而,与数据互操作性挑战,特别是缺乏医学代码,阻碍了跨研究的数据集成。虽然大语言模型(LLM)提供了一种不依赖标注数据即可实现自动编码的有前景的解决方案,但当前方法在复杂编码任务中面临挑战。我们引入ALIGN,这是一种新的组合式LLM-based系统,用于自动、零样本的医学编码。ALIGN遵循三个步骤:(1) 多样化候选代码生成;(2) 代码的自评估;(3) 置信度评分和不确定性估计,使人类能够委托以确保可靠性。我们在从22个免疫学试验中提取的药物术语转化为解剖学-药理学化学(Anatomical Therapeutic Chemical, ATC)和医学史术语转化为医学监管活动词典(Medical Dictionary for Regulatory Activities, MedDRA)代码上评估了ALIGN。ALIGN在LLM基线之上取得了优异成绩,同时也提供了可信赖部署的能力。对于MedDRA编码,ALIGN在所有层级上都实现了高准确率,匹配RAG的表现,并在最具体的层级(87-90% HLGT)中表现突出。对于ATC编码,ALIGN表现出色,特别是在较低的层级(ATC Level 4),实现了72-73%的总体准确率和86-89%的常见药物准确率,超越基线7-22%。ALIGN的基于不确定性的委托机制使准确率提高了17%,达到90%的准确率(30%委托),显著提升了在不常见药物上的表现。ALIGN以0.00070.0007和0.02每个代码的成本实现了GPT-4o-mini和GPT-4o的成本效益,降低了临床采用门槛。ALIGN推动了临床试验数据自动化医学编码的发展,为增强数据互操作性和可重用性做出了贡献,作为改善临床研究和加速药物开发的有前景的工具。

关键词

引用

@article{arxiv.2411.13163,
  title  = {Unlocking Historical Clinical Trial Data with ALIGN: A Compositional Large Language Model System for Medical Coding},
  author = {Nabeel Seedat and Caterina Tozzi and Andrea Hita Ardiaca and Mihaela van der Schaar and James Weatherall and Adam Taylor},
  journal= {arXiv preprint arXiv:2411.13163},
  year   = {2025}
}