面向肿瘤学的可扩展与跨语言专用语言模型
计算与语言
2025-03-12 v1
摘要
临床肿瘤学会产生大量非结构化数据,这些数据通常包含不一致、缺失的信息和歧义,使得难以提取可靠的见解以进行数据驱动的决策。通用大语言模型(LLM)由于缺乏特定领域的推理能力(包括专业临床术语、上下文相关解释和多模态数据集成),在应对这些挑战时显得力不从心。我们通过一个肿瘤学专用、高效且适应性强的 NLP 框架来解决这些问题,该框架结合了指令微调、检索增强生成(RAG)和基于图的知识集成。我们的轻量级模型在肿瘤学特定任务中证明是有效的,例如命名实体识别(如识别癌症诊断)、实体链接(如将实体链接到标准化本体)、TNM 分期、文档分类(如从病理报告中分类癌症亚型)以及治疗反应预测。我们的框架强调适应性和资源效率。我们包含了在苏黎世大学医院(USZ)收集的最少量的德语指令,以测试少量非英语语言数据能否有效地跨语言迁移知识。这种方法反映了我们对轻量级模型的动机,即在降低计算成本的同时平衡强大的性能,使其适用于资源受限的医疗机构。我们在肿瘤学数据集上验证了我们的模型,在命名实体识别、关系抽取和文档分类方面展示了优异的结果。
引用
@article{arxiv.2503.08323,
title = {Towards Scalable and Cross-Lingual Specialist Language Models for Oncology},
author = {Morteza Rohanian and Tarun Mehra and Nicola Miglino and Farhad Nooralahzadeh and Michael Krauthammer and Andreas Wicki},
journal= {arXiv preprint arXiv:2503.08323},
year = {2025}
}