实时 MRI 中用于声道分割的语音引导多模态学习
计算机视觉与模式识别
2026-05-19 v1
摘要
在实时 MRI(rtMRI)中分割声道发音器官是一个极具挑战性的动态图像分割问题,具有对比度低、运动迅速和空间分辨率有限的特点。然而,尽管 rtMRI 采集可能提供同步的声学信号,现有方法却忽略了这一信息,而少数结合音频的多模态方法在音频不可用时无法部署。我们提出了一个三阶段框架,在训练期间利用声学和语音学监督,而在推理时仅需 rtMRI 图像:将语音学表示转换为用于发音器官定位的空间边界框先验,通过双层跨模态对比预训练对齐视觉和声学编码器,并通过交叉注意力解码器融合所学表示,从而有效地将多模态知识迁移至单模态推理流程中。在 75-Speaker~Annot-16 和 USC-TIMIT 数据集上的评估表明,我们的方法优于现有的单模态和多模态方法,证明了多模态监督可为精确且临床可部署的声道分割提供可迁移的益处。
引用
@article{arxiv.2605.18466,
title = {Speech-Guided Multimodal Learning for Vocal Tract Segmentation in Real-Time MRI},
author = {Daiqi Liu and Lukas Mulzer and Md Hasan and Nyvenn de Castro and Fangxu Xing and Xingjian Kang and Chengze Ye and Siyuan Mei and Yipeng Sun and Tomás Arias-Vergara and Jana Hutter and Jonghye Woo and Andreas Maier and Paula Andrea Pérez-Toro},
journal= {arXiv preprint arXiv:2605.18466},
year = {2026}
}
备注
under review