面向实时MRI的多模态 vocal tract 分割-VocSegMRI
计算机视觉与模式识别
2026-03-26 v4
摘要
准确分割实时MRI(rtMRI)中的 articulatory 结构 remains 具有挑战性,因为现有方法主要依赖视觉线索,忽略了来自同步语音信号的互补信息。我们提出VocSegMRI,一种集成视频、音频和语音学输入的多模态框架,通过跨注意力融合和对比学习目标提高跨模态对齐和分割精度。在USC-75数据集上进行评估,并通过在USC-TIMIT上的零样本迁移进行进一步验证,VocSegMRI在无单模态和多模态基线方法上均表现出优势,消融实验确认了每个组件的贡献。
引用
@article{arxiv.2509.13767,
title = {VocSegMRI: Multimodal Learning for Precise Vocal Tract Segmentation in Real-time MRI},
author = {Daiqi Liu and Johannes Enk and Maureen Stone and Fangxu Xing and Tomás Arias-Vergara and Jerry L. Prince and Jana Hutter and Jonghye Woo and Andreas Maier and Paula Andrea Pérez-Toro},
journal= {arXiv preprint arXiv:2509.13767},
year = {2026}
}
备注
Preprint submitted to MIDL short paper 2026