中文

微调基础模型以从兽医健康记录中生成诊断

计算与语言 2025-08-22 v2 人工智能

摘要

兽医病历代表了一种大规模数据资源,可用于应用于兽医和 One Health 临床研究。由于数据格式不一致和数据孤岛等互操作性挑战,数据使用受到限制。使用标准化医学术语进行临床编码可提高病历质量,并促进其与来自其他机构的兽医和人类健康记录的互操作性。以往研究,如 DeepTag 和 VetTag,评估了将自然语言处理(NLP)应用于自动化兽医诊断编码的效果,采用长短期记忆网络(LSTM)和变换器模型从自由文本临床笔记中推断一部分 Systemized Nomenclature of Medicine - Clinical Terms(SNOMED-CT)诊断编码。本研究扩展了这些 efforts,纳入 Colorado State University(CSU)兽医教学医院(VTH)所认可的全部 7,739 个 distinct SNOMED-CT 诊断编码,并利用日益增长的预训练语言模型(LMs)。对 13 个免费可用的预训练 LMs 在来自 246,473 份手工编码的兽医患者就诊记录(来自 CSU VTH 的电子健康记录)上进行微调,结果优于以往的 efforts。最准确的结果来自使用扩充标记数据对相对较大的临床 LMs 进行微调,但该研究也表明,在有限资源和非临床 LMs 的情况下,也可以获得相当的结果。本研究的结果有助于提高兽医电子健康记录(EHR)的质量,通过调查可及的方法实现自动编码,从而支持动物和人类健康研究,为跨物种和跨机构的综合健康数据库的集成与全面化铺平了道路。

关键词

引用

@article{arxiv.2410.15186,
  title  = {Fine-tuning foundational models to code diagnoses from veterinary health records},
  author = {Mayla R. Boguslav and Adam Kiehl and David Kott and G. Joseph Strecker and Tracy Webb and Nadia Saklou and Terri Ward and Michael Kirby},
  journal= {arXiv preprint arXiv:2410.15186},
  year   = {2025}
}

备注

26 pages, 5 figures