用于改进语音产生实时 MRI 视频中气-组织边界的误差校正方案
计算机视觉与模式识别
2022-03-14 v1 音频与语音处理
摘要
已知在语音产生的实时磁共振成像(rtMRI)视频的气-组织边界(ATB)分割中,最佳性能由三维卷积神经网络(3D-CNN)模型取得。然而,该模型以及文献中报道的其他 ATB 分割技术的评估,均采用整个原始轮廓与预测轮廓之间的动态时间规整(DTW)距离。此类评估度量可能无法捕捉预测轮廓中的局部误差。对预测轮廓的细致分析揭示了在 contour1(由上门唇、硬腭和软腭组成的 ATB)的软腭部分,以及 contour2(覆盖下颌线、下唇、舌根和会厌的 ATB)的舌根区段存在误差,而这些未被 DTW 距离之类的全局评估指标所捕捉。本工作中,我们自动检测此类误差并提出相应的校正方案。我们还针对 contour1 与 contour2 的 ATB 分割分别提出两种新评估度量,以显式捕捉这些轮廓中的两类误差。所提出的检测与校正策略使 contour1 的这两种评估度量分别提升 61.8% 和 61.4%,使 contour2 分别提升 67.8% 和 28.4%。相比之下,传统 DTW 距离在 contour1 上提升 44.6%,在 contour2 上提升 4.0%。
引用
@article{arxiv.2203.06004,
title = {An error correction scheme for improved air-tissue boundary in real-time MRI video for speech production},
author = {Anwesha Roy and Varun Belagali and Prasanta Kumar Ghosh},
journal= {arXiv preprint arXiv:2203.06004},
year = {2022}
}
备注
accepted for ICASSP 2022