中文

ECG-LLM:面向心电图的领域特定大语言模型训练与评估

计算与语言 2025-10-22 v1 机器学习

摘要

领域适应的开源大语言模型(LLM)正在为医疗保健领域的应用提供前景,从可查询的知识库到多模态助手,关键优势在于能够本地部署以保留隐私。然而,最佳适应策略、评估方法以及相对于通用LLM的性能仍然不清晰。我们在心电图(心血管医学的重要领域)进行了研究,通过在领域特定文献上微调开源模型并实施多层次评估框架来比较微调模型、检索增强生成(RAG)和Claude Sonnet 3.7作为代表性通用模型。微调的Llama 3.1 70B在多项选择题评估和自动文本指标上实现了卓越的性能,在LLM-as-a-judge评估中位居第二。人类专家评估偏好Claude 3.7和RAG方法用于复杂查询。微调模型在几乎所有评估模式下均显著优于其基础模型。我们的发现揭示了不同评估方法之间的显著性能差异,凸显了评估的复杂性。尽管如此,领域特定的适应通过微调和RAG实现了与专有模型相当的性能,支持隐私保留、可本地部署的临床解决方案的可行性。

关键词

引用

@article{arxiv.2510.18339,
  title  = {ECG-LLM -- training and evaluation of domain-specific large language models for electrocardiography},
  author = {Lara Ahrens and Wilhelm Haverkamp and Nils Strodthoff},
  journal= {arXiv preprint arXiv:2510.18339},
  year   = {2025}
}

备注

34 pages, 8 figures, code available at https://github.com/AI4HealthUOL/ecg-llm