中文

LLaVA Needs More Knowledge:基于知识图谱的检索增强自然语言生成用于解释胸部解剖病理

计算机视觉与模式识别 2024-12-20 v2

摘要

生成针对医学图像(尤其是显示胸部解剖病理的图像)模型预测的自然语言解释,仍是关键且具有挑战性的任务。现有方法往往难以解决 general 模型缺乏领域特定医学知识以及检索增强技术相关隐私问题。为此,我们提出了一种新型视觉语言框架,辅以知识图谱(KG)存储库,增强模型的理解,通过纳入生成准确且信息丰富解释所必需的领域特定医学知识。该框架采用KG基础检索机制,不仅提高了生成解释的精度,还通过避免直接数据检索来保留数据隐私。KG存储库设计为即插即用模块,允许无缝集成到各种模型架构中。我们在此范式中引入并评估了三个不同框架:KG-LLaVA 将预训练的LLaVA模型与KG-RAG集成;Med-XPT 是一种自定义框架,结合MedCLIP、基于转换器的投影器和GPT-2;Bio-LLaVA 则通过纳入Bio-ViT-L视觉模型来适应LLaVA。这些框架在MIMIC-NLE数据集上得到验证,其中它们实现了最先进的成果,凸显了KG增强在为胸部解剖病理生成高质量NLE方面的有效性。

关键词

引用

@article{arxiv.2410.04749,
  title  = {LLaVA Needs More Knowledge: Retrieval Augmented Natural Language Generation with Knowledge Graph for Explaining Thoracic Pathologies},
  author = {Ameer Hamza and Abdullah and Yong Hyun Ahn and Sungyoung Lee and Seong Tae Kim},
  journal= {arXiv preprint arXiv:2410.04749},
  year   = {2024}
}

备注

AAAI2025