中文

评估视觉语言模型适配在低资源语言放射学报告生成中的表现

计算机视觉与模式识别 2026-02-16 v1 计算与语言

摘要

人工智能在医疗保健领域的整合为改善医学诊断和患者护理开辟了新的前景。然而,在开发能够生成准确且与上下文相关的放射学报告的系统方面,尤其是在低资源语言中,挑战依然存在。在本研究中,我们提出了一个全面的基准,用于评估经过指令微调的视觉语言模型 (VLM) 在三种低资源语言(意大利语、德语和西班牙语)的放射学报告生成这一专门任务中的表现。我们采用 LLaVA 架构框架,对利用通用数据集、领域特定数据集和低资源语言特定数据集的预训练模型进行了系统性评估。鉴于缺乏同时具备医学领域和低资源语言先验知识的模型,我们分析了各种适应性调整,以确定在这些情境下最有效的方法。结果显示,语言特定的模型在生成放射学报告方面显著优于通用模型和领域特定模型,这强调了语言适应性的关键作用。此外,与具备通用知识的模型相比,使用医学术语进行微调的模型在所有语言中都表现出增强的性能,这突显了领域特定训练的重要性。我们还探讨了温度参数对报告生成连贯性的影响,为最佳模型设置提供了见解。我们的发现强调了定制化的语言和领域特定训练对于提高多语言环境下放射学报告质量和准确性的重要性。这项研究不仅增进了我们对 VLM 在医疗保健领域适应性的理解,也为未来在模型调优和语言特定适应性方面的研究指明了重要方向。

关键词

引用

@article{arxiv.2505.01096,
  title  = {Evaluating Vision Language Model Adaptations for Radiology Report Generation in Low-Resource Languages},
  author = {Marco Salmè and Rosa Sicilia and Paolo Soda and Valerio Guarrasi},
  journal= {arXiv preprint arXiv:2505.01096},
  year   = {2026}
}