用于辅助诊断声带麻痹的多模态喉镜视频分析
声音
2026-03-10 v4 人工智能
音频与语音处理
摘要
本文提出了多模态喉镜视频分析系统,这是一个利用音频和视频数据从原始喉视频频闪镜视频中自动提取关键视频片段和指标以辅助临床评估的新颖系统。该系统将基于视频的声门检测与音频关键词定位方法相结合,以分析视频和音频数据,识别患者发声并精炼视频亮点,从而确保对声带运动的最佳检查。除了从原始喉镜视频中提取关键视频片段外,MLVAS 还能够为声带麻痹检测生成有效的音频和视觉特征。利用预训练的音频编码器对患者声音进行编码以获取音频特征。视觉特征则是通过测量分割出的声门掩码上左右声带与估计的声门中线之间的角度偏差来生成的。为了获得更好的掩码,我们引入了一种基于扩散的精炼方法,该方法在传统 U-Net 分割之后进行,以减少假阳性。我们进行了多项消融研究,以证明所提出的 MLVAS 中各模块和模态的有效性。在公开分割数据集上的实验结果表明了我们提出的分割模块的有效性。此外,在真实世界临床数据集上的单侧 VFP 分类结果证明了 MLVAS 能够提供可靠的客观指标以及用于辅助临床诊断的可视化。
引用
@article{arxiv.2409.03597,
title = {Multimodal Laryngoscopic Video Analysis for Assisted Diagnosis of Vocal Fold Paralysis},
author = {Yucong Zhang and Xin Zou and Jinshan Yang and Wenjun Chen and Juan Liu and Faya Liang and Ming Li},
journal= {arXiv preprint arXiv:2409.03597},
year = {2026}
}
备注
Accepted by Computer Speech and Language