用于识别语音中舌运动共同与个体特异性功能单元的深层联合稀疏非负矩阵分解框架
计算机视觉与模式识别
2021-06-08 v2 图像与视频处理
摘要
可懂语音由变化的内在局部肌群——即功能单元——以系统且协调的方式生成。在表征与分析功能单元时有两大挑战。首先,由于舌结构与功能的复杂和盘绕本质,开发能准确解码语音中复杂肌肉协调模式的方法极为重要。其次,由于个体间显著差异,保持跨被试识别的功能单元具有可比性颇具挑战。本工作中,为应对这些挑战,我们开发了一个新的深度学习框架,以识别语音中舌运动的共同与个体特异性功能单元。我们的框架基于联合深度图正则化稀疏非负矩阵分解(NMF),使用由标记磁共振成像位移导出的运动量。更具体地,我们通过展开迭代收缩阈值算法,将带稀疏与图正则化的 NMF 转化为类似深度神经网络的模块化架构,以学习可解释的基元及关联的权重图。随后我们对共同与个体特异性权重图应用谱聚类,由此联合确定共同与个体特异性功能单元。在模拟数据集上的实验表明,所提方法取得了与对比方法相当或更好的聚类性能。在活体舌运动数据上的实验表明,所提方法能以更高的可解释性与更小的尺寸变异性确定共同与个体特异性功能单元。
引用
@article{arxiv.2007.04865,
title = {A Deep Joint Sparse Non-negative Matrix Factorization Framework for Identifying the Common and Subject-specific Functional Units of Tongue Motion During Speech},
author = {Jonghye Woo and Fangxu Xing and Jerry L. Prince and Maureen Stone and Arnold Gomez and Timothy G. Reese and Van J. Wedeen and Georges El Fakhri},
journal= {arXiv preprint arXiv:2007.04865},
year = {2021}
}
备注
Accepted by Medical Image Analysis