利用自监督学习与注意力机制改进从唇部图像重建超声舌图像的方案
音频与语音处理
2021-06-23 v1 计算机视觉与模式识别
机器学习
声音
图像与视频处理
摘要
语音产生是一个动态过程,涉及舌、颌和唇等多个人体器官。对声道形变动力学进行建模是理解人类日常最常用交流方式——语音——的基本问题。研究者采用若干感官流同时描述该过程,这些感官流无疑与其他流存在统计关联。本文探讨如下问题:给定可观测的唇部图像序列,我们能否描绘出对应的舌部运动。我们将此问题表述为自监督学习问题,并采用双流卷积网络与长短期记忆网络(long-short memory network)配合注意力机制来完成该学习任务。我们利用无标签唇部视频预测即将出现的超声舌图像序列,以此评估所提方法的性能。结果表明,我们的模型能够生成接近真实超声舌图像的图像,并实现两种成像模态间的匹配。
引用
@article{arxiv.2106.11769,
title = {Improving Ultrasound Tongue Image Reconstruction from Lip Images Using Self-supervised Learning and Attention Mechanism},
author = {Haiyang Liu and Jihan Zhang},
journal= {arXiv preprint arXiv:2106.11769},
year = {2021}
}
备注
Accepted in KDD Workshop (BIOKDD 2021)