使用通用视觉语言模型分析血液报告图像
计算机视觉与模式识别
2026-05-01 v1
摘要
可靠地分析血液报告对于健康知识至关重要,但个体常常难以解读,导致焦虑并忽视问题。我们探讨了使用通用视觉语言模型(VLMs)来解决这一挑战的方法,通过自动分析血液报告图像。我们对三个 VLMs(Qwen-VL-Max、Gemini 2.5 Pro 和 Llama 4 Maverick)进行了比较评估,这些模型在包含 100 个多样化血液报告图像的数据集上的表现如何。每个模型都被提示对每份血液报告提出临床相关问题。随后,使用 Sentence-BERT 处理答案,以比较和评估模型如何接近正确回答。我们的发现表明,通用 VLMs 是一种实用且有前景的技术,可用于开发面向患者的血液报告分析工具。它们能够直接从图像中提供清晰的解释,可提高健康素养并减少对理解复杂医学信息的限制。本工作为未来开发可靠且可接近的 AI 辅助医疗应用程序奠定了基础。尽管结果令人鼓舞,但应谨慎解读,因为数据集规模有限。
引用
@article{arxiv.2509.06033,
title = {Analysis of Blood Report Images Using General Purpose Vision-Language Models},
author = {Nadia Bakhsheshi and Hamid Beigy},
journal= {arXiv preprint arXiv:2509.06033},
year = {2026}
}
备注
4 pages , 3 figures , This paper has been submitted to the IEEE-affiliated ICBME Conference (Iran), 2025, and is currently under review. DOR number: [20.1001.2.0425023682.1404.10.1.440.7]