中文

BUSTR:基于描述符感知视觉语言模型的乳腺超声文本报告生成

计算机视觉与模式识别 2025-11-27 v1 人工智能 机器学习

摘要

乳腺超声(BUS)的自动放射报告生成(RRG)受限于缺乏成对的图像-报告数据集以及大语言模型产生幻觉的风险。我们提出BUSTR,一个多任务视觉语言框架,无需成对的图像-报告监督即可生成BUS报告。BUSTR从结构化描述符(例如BI-RADS、病理学、组织学)和影像组学特征构建报告,使用通过多任务损失在数据集特定的描述符集上训练的多头Swin编码器学习描述符感知的视觉表示,并通过一个双层级目标对齐视觉和文本标记,该目标结合了标记级交叉熵损失与输入和输出表示之间的余弦相似度对齐损失。我们在两个公开的BUS数据集BrEaST和BUS-BRA上评估了BUSTR,这两个数据集在规模和可用描述符上有所不同。在这两个数据集上,BUSTR均持续改进了标准的自然语言生成指标和临床效能指标,尤其是在BI-RADS类别和病理学等关键目标上。我们的结果表明,这种描述符感知的视觉模型,通过结合标记级和对齐损失进行训练,无需成对的图像-报告数据即可改进自动报告指标和临床效能。源代码可在https://github.com/AAR-UNLV/BUSTR找到。

关键词

引用

@article{arxiv.2511.20956,
  title  = {BUSTR: Breast Ultrasound Text Reporting with a Descriptor-Aware Vision-Language Model},
  author = {Rawa Mohammed and Mina Attin and Bryar Shareef},
  journal= {arXiv preprint arXiv:2511.20956},
  year   = {2025}
}

备注

13 pages, 2 figures, 6 tables