面向精准医疗AI助手的视觉与语言增强关联
计算机视觉与模式识别
2025-05-07 v1 人工智能
图像与视频处理
摘要
医疗AI助手在疾病诊断、医学图像分析和报告生成方面为医生提供支持。然而,它们在临床应用中仍面临重大挑战,包括多模态内容的准确性有限以及在真实世界环境中验证不足。我们提出了RCMed,一个全栈AI助手,它改进了输入和输出中的多模态对齐,通过分层的视觉-语言对齐实现精确的解剖结构描绘、准确定位和可靠诊断。一种自增强关联机制允许视觉特征影响语言上下文,同时语言语义引导像素级注意力,形成一个闭环以优化两种模态。这种关联通过一种颜色区域描述策略得到增强,该策略将解剖结构转化为语义丰富的文本,以跨尺度学习形状-位置-文本关系。RCMed在2000万个图像-掩码-描述三元组上训练,在描述不规则病变和细微解剖边界方面达到了最先进的精度,在9种模态的165项临床任务中表现出色。与先前方法相比,它在显微镜图像的细胞分割上实现了23.5%的相对改进。RCMed强大的视觉-语言对齐使其具有卓越的泛化能力,在包括新任务在内的20种具有临床意义的癌症类型的外部验证中取得了最先进的性能。这项工作展示了集成多模态模型如何捕捉细粒度模式,从而在复杂场景中实现人类水平的解读,并推动以人为中心的AI医疗保健发展。
引用
@article{arxiv.2505.03380,
title = {Reinforced Correlation Between Vision and Language for Precise Medical AI Assistant},
author = {Haonan Wang and Jiaji Mao and Lehan Wang and Qixiang Zhang and Marawan Elbatel and Yi Qin and Huijun Hu and Baoxun Li and Wenhui Deng and Weifeng Qin and Hongrui Li and Jialin Liang and Jun Shen and Xiaomeng Li},
journal= {arXiv preprint arXiv:2505.03380},
year = {2025}
}