基于多提示者语料库的提示语音可解释且可泛化的重同步新模型
音频与语音处理
2023-06-06 v1 计算与语言
计算机视觉与模式识别
摘要
提示语音(Cued Speech, CS)是一种多模态视觉编码系统,在语音层面将唇读与若干手势提示相结合,使听障人士能够看见口语。以往研究通过针对英语和法语CS的依赖于提示者(cuer\footnote{执行提示语音的人称为提示者})的分段线性模型来解决唇部与手部运动之间的异步问题。在本工作中,我们创新性地提出对唇部流的三项统计度量,以构建可解释且可泛化的模型来预测手部前置时间(HPT),并通过适当的归一化实现与提示者无关。特别地,我们构建了首个普通话CS语料库,包含来自五名说话人的标注视频,其中三名为正常人、两名为听障人士。进而,我们表明手部前置现象存在于普通话CS生成中,且正常人与听障人士之间存在显著差异。大量实验表明,我们的模型优于基线及以往最先进的方法。
引用
@article{arxiv.2306.02596,
title = {A Novel Interpretable and Generalizable Re-synchronization Model for Cued Speech based on a Multi-Cuer Corpus},
author = {Lufei Gao and Shan Huang and Li Liu},
journal= {arXiv preprint arXiv:2306.02596},
year = {2023}
}
备注
5 pages, 4 figures, Accepted to INTERSPEECH2023