基于去噪卷积自编码器的 B 型超声舌图像特征提取
图像与视频处理
2019-03-05 v1
摘要
B 型超声舌成像在语音产生领域被广泛使用。然而,舌图像序列的高效解释需求迫切。受近期无监督深度学习方法成功的启发,我们探索了用于超声舌图像特征提取的无监督卷积网络架构,这有助于临床语言学和语音学。通过对不同无监督特征提取方法进行定量比较,基于去噪卷积自编码器(DCAE)的方法在重构任务和 2010 年无声语音接口挑战赛中优于其他特征提取方法。使用 DCAE 获得了 6.17\% 的词错率,而使用离散余弦变换作为特征提取器的最先进方法的词错率为 6.45\%。我们的代码可在 https://github.com/DeePBluE666/Source-code1 获取。
引用
@article{arxiv.1903.00888,
title = {Denoising convolutional autoencoder based B-mode ultrasound tongue image feature extraction},
author = {Bo Li and Kele Xu and Dawei Feng and Haibo Mi and Huaimin Wang and Jian Zhu},
journal= {arXiv preprint arXiv:1903.00888},
year = {2019}
}
备注
Accepted by ICASSP 2019