中文

ProMRVL-CAD:面向计算机辅助诊断的多轮视觉语言交互主动对话系统

人工智能 2025-02-18 v1

摘要

近期大语言模型(LLM)的快速发展在 various vision-language 任务上展现了惊人的理解能力和突破性成果。然而,LLM应用于生成可靠医学诊断报告的工作仍处于早期阶段。当前,医学LLM通常采用被动交互模型,即医生针对患者查询作出回应,几乎不涉及分析医学图像。相比之下,一些ChatBot仅基于视觉输入响应预定义的查询,缺乏交互式对话或对医学史的考虑。因此,在LLM生成的患者-ChatBot交互与实际患者-医生咨询之间存在差距。为弥合这一差距,我们开发了一个基于LLM的对话系统,称为主动多轮视觉语言交互计算机辅助诊断系统(Proactive multi-round Vision-Language Interactions for Computer-Aided Diagnosis, ProMRVL-CAD),以生成患者友好型疾病诊断报告。该提出的ProMRVL-CAD系统允许主动对话,通过将知识图谱集成到推荐系统中,为患者提供持续可靠的医学服务。具体而言,我们设计了两个生成器:一个主动问题生成器(Pro-Q Gen),用于生成引导诊断过程的主动问题;一个多视觉患者-文本诊断报告生成器(MVP-DR Gen),用于生成高质量的诊断报告。在评估两个真实世界公开可用数据集(MIMIC-CXR和IU-Xray)时,我们的模型在生成医学报告方面表现更佳。我们进一步展示了ProMRVL在低图像质量情景下仍能实现稳健性能。此外,我们创建了一个模拟患者与医生之间主动诊断交互的合成医学对话数据集,为训练LLM提供了宝贵的资源。

关键词

引用

@article{arxiv.2502.10620,
  title  = {ProMRVL-CAD: Proactive Dialogue System with Multi-Round Vision-Language Interactions for Computer-Aided Diagnosis},
  author = {Xueshen Li and Xinlong Hou and Ziyi Huang and Yu Gan},
  journal= {arXiv preprint arXiv:2502.10620},
  year   = {2025}
}

备注

17 pages, 6 figures