中文

MammoWise:用于乳腺钼片报告生成的多模型局部RAG管道

计算机视觉与模式识别 2026-02-27 v1 信息检索

摘要

乳腺钼片筛查是高流量、高灵敏度和文档密集型检查。放射科医生必须将细微的视觉发现翻译为一致的BI-RADS评估、乳腺密度分类和结构化叙述报告。虽然最近的视觉语言模型(VLM)实现了图像到文本报告,但许多依赖封闭云系统或紧密耦合的体系结构限制了隐私、可重复性和适应性。我们提出MammoWise,一个局部多模型管道,将开源VLM转化为乳腺钼片报告生成器和多任务分类器。MammoWise支持任何托管Ollama的VLM和乳腺钼片数据集,支持零样本、少样本和链式思考提示,可选用基于向量数据库的多模态检索增强生成(RAG)。我们在VinDr-Mammo和DMID数据集上评估MedGemma、LLaVA-Med和Qwen2.5-VL,评估报告质量(BERTScore、ROUGE-L)、BI-RADS分类、乳腺密度和关键发现。报告生成始终表现良好,少样本提示和RAG可显著提升。分类可行但对模型和数据集选择敏感。参数高效微调(QLoRA)可提升MedGemma可靠性,实现BI-RADS准确率0.7545、密度准确率0.8840和钙化物准确率0.9341,同时保持报告质量。MammoWise为在统一且可重复的工作流程中部署本地VLM进行乳腺钼片报告提供了实用且可扩展的框架。

关键词

引用

@article{arxiv.2602.22462,
  title  = {MammoWise: Multi-Model Local RAG Pipeline for Mammography Report Generation},
  author = {Raiyan Jahangir and Nafiz Imtiaz Khan and Amritanand Sudheerkumar and Vladimir Filkov},
  journal= {arXiv preprint arXiv:2602.22462},
  year   = {2026}
}

备注

arXiv preprint (submitted 25 Feb 2026). Local multi-model pipeline for mammography report generation + classification using prompting, multimodal RAG (ChromaDB), and QLoRA fine-tuning; evaluates MedGemma, LLaVA-Med, Qwen2.5-VL on VinDr-Mammo and DMID; reports BERTScore/ROUGE-L and classification metrics