面向快速 MRI 的基础模型实用性研究:面向视觉-语言的图像重建
计算机视觉与模式识别
2025-11-26 v1 人工智能
摘要
目的:探讨视觉-语言基础模型是否可以通过提供常规先验之外的高层次上下文信息来增强不完全采样的 MRI 重建。方法:我们提出了一种语义分布引导的重建框架,使用预训练的视觉-语言基础模型对重建图像和辅助信息进行编码,以生成高层次语义特征。对比学习目标将重建表示与目标语义分布对齐,以确保与高层次感知线索的一致性。该目标可与各种基于深度学习的重建方法配合使用,可灵活地整合来自多模态来源的语义先验。为测试这些语义先验的有效性,我们评估了由仅来自图像或图像-语言辅助信息派生的先验所指导的重建结果。结果:髋关节和脑部数据集上的实验表明,来自图像的语义先验可保留细微解剖结构,实现优异的感知质量,体现在 LPIPS 值降低、Tenengrad 分数提升以及读者研究中评分提高,这些都优于常规正则化方法。图像-语言信息进一步扩充了语义分布,实现对重建属性的高层次控制。在所有评估中,对比学习目标始终引导重建特征趋向所需的语义分布,同时保持数据保真度,证明了所提优化框架的有效性。结论:该研究表明,视觉-语言基础模型可通过语义空间优化改进不完全采样的 MRI 重建。
引用
@article{arxiv.2511.19641,
title = {On the Utility of Foundation Models for Fast MRI: Vision-Language-Guided Image Reconstruction},
author = {Ruimin Feng and Xingxin He and Ronald Mercer and Zachary Stewart and Fang Liu},
journal= {arXiv preprint arXiv:2511.19641},
year = {2025}
}