中文

基于 LLM 的 mCODE 数据模型新发展:提升肿瘤学临床试验匹配效率以实现标准化与互操作性

机器学习 2024-10-29 v1

摘要

每年,癌症护理中数据标准化和互操作性不足,都会严重导致及时且有效的诊断缺失,同时不断增加成本,2023 年全国癌症费用已达 2080 亿美元。传统的癌症学临床试验招募和临床护理方法往往是手动、耗时且缺乏数据驱动方法。本文提出了一种新框架,以 streamlining 标准化、互操作性和癌症领域数据交换,增强跨不同医疗系统中基于肿瘤学的 EHR 集成。本文利用先进的大语言模型和计算机工程,以 streamlining 癌症临床试验和发现。通过利用 FHIR 的资源方法和 LLM 生成的 mCODE 框架,我们确保了在跨不同医疗系统之间共享患者信息的及时、准确和高效。我们的 methodology 涉及将非结构化患者治疗数据、PDF、自由文本信息和病程记录转换为丰富的 mCODE 框架,促进与我们 novel AI 和 ML-based 临床试验匹配引擎的无缝集成。本研究结果显示,我们训练的 LLM 在数据标准化方面准确率达到了超过 92%,数据集包含数千位患者数据。此外,我们的 LLM 对 SNOMED-CT 的准确率为 87%,对 LOINC 的准确率为 90%,对 RxNorm 代码的准确率为 84%。这超过了当前的现状水平,像 GPT-4 和 Claude 3.5 的平均峰值仅为 77%。本文成功阐明了我们标准化和互操作性 framework 的潜力,为更高效和更个性化的癌症治疗铺平了道路。

关键词

引用

@article{arxiv.2410.19826,
  title  = {Novel Development of LLM Driven mCODE Data Model for Improved Clinical Trial Matching to Enable Standardization and Interoperability in Oncology Research},
  author = {Aarsh Shekhar and Mincheol Kim},
  journal= {arXiv preprint arXiv:2410.19826},
  year   = {2024}
}

备注

18 pages, 13 figures, accessible and published at: The Young Researcher Fall 2024 Volume 8, Number 2(Special Edition in Collaboration with Harvard Undergraduate Openbio Laboratory); Pages 28-45