OmniMRI:面向通用 MRI 解释的统一视觉-语言基础模型
计算机视觉与模式识别
2025-08-26 v1 人工智能
摘要
磁共振成像(MRI)在临床实践中至关重要,但受限于碎片化的、多阶段的工作流程,涵盖获取、重建、分割、检测、诊断和报告等环节。虽然深度学习在单个任务上取得了进展,但现有方法往往是特定解剖学或特定应用的,缺乏在不同临床环境下的通用性。此外,当前的管道很少整合imaging data与辅助语言信息,而后者是放射科医生日常实践中所依赖的。本文介绍 OmniMRI,一个统一的视觉-语言基础模型,旨在跨越整个 MRI 工作流程。OmniMRI 在来自 60 个公开数据集、超过 22 万个 MRI 体数据和 1900 万个 MRI 切片的大规模异构语料库上进行训练,包含仅图像数据、配对视觉-文本数据以及指令-响应数据。其多阶段训练范式包括自监督视觉预训练、视觉-语言对齐、多模态预训练和多任务指令调优,逐步为模型提供可迁移的视觉表征、跨模态推理和稳健的指令遵循能力。定性结果表明,OmniMRI 能够在单一架构中执行多样化任务,包括 MRI 重建、解剖学和病理分割、异常检测、诊断建议和放射报告生成。这些发现凸显了 OmniMRI 将碎片化管道整合为可扩展的通用框架的潜力,为通往统一 imaging 与临床语言的 foundation 模型之路,实现全面、端到端的 MRI 解释。
引用
@article{arxiv.2508.17524,
title = {OmniMRI: A Unified Vision--Language Foundation Model for Generalist MRI Interpretation},
author = {Xingxin He and Aurora Rofena and Ruimin Feng and Haozhe Liao and Zhaoye Zhou and Albert Jang and Fang Liu},
journal= {arXiv preprint arXiv:2508.17524},
year = {2025}
}