VLM-KG:基于多模态视觉语言模型的放射学知识图谱生成
计算与语言
2025-05-26 v1 计算机视觉与模式识别
信息检索
机器学习
摘要
视觉语言模型(VLM)在自然语言生成方面展现了显著的成功,尤其擅长指令遵循和结构化输出生成。知识图谱在放射学中发挥着关键作用,作为提供事实信息的宝贵来源,增强各种下游任务的性能。然而,生成放射学特定知识图谱面临着显著的挑战,due to 放射学报告的专业语言以及特定数据稀缺。现有解决方案主要是单模态的,即仅从放射学报告生成知识图谱,而不包含放射学图像。此外,它们在处理长篇放射学数据时也困难,因为受限于上下文长度。为此,我们提出了一种新型基于 VLM 的多模态框架,用于放射学知识图谱生成。我们的方法超越了先前的方法,引入了首个针对放射学知识图谱生成的多模态解决方案。
引用
@article{arxiv.2505.17042,
title = {VLM-KG: Multimodal Radiology Knowledge Graph Generation},
author = {Abdullah Abdullah and Seong Tae Kim},
journal= {arXiv preprint arXiv:2505.17042},
year = {2025}
}
备注
10 pages, 2 figures