中文

CoCA-MDD:一种基于耦合交叉注意力的流式发音错误检测与诊断框架

计算与语言 2022-06-30 v2 声音 音频与语音处理

摘要

发音错误检测与诊断(MDD)是计算机辅助发音训练(CAPT)系统中的热门研究焦点。端到端(e2e)方法在MDD中正变得占主导地位。然而,e2e MDD模型通常需要完整语音片段作为输入上下文,这导致显著的时延,尤其对于长段落。我们提出了一种称为CoCA-MDD的流式e2e MDD模型。我们利用conv-transformer结构以流式方式编码输入语音。提出一种耦合交叉注意力(CoCA)机制,用于将帧级声学特征与编码后的参考语言特征相融合。CoCA还使我们的模型能够利用完整语音片段进行发音错误分类。所提模型允许流式输出与发音错误分类输出之间进行系统融合以进一步提升性能。我们在公开可用语料库上评估CoCA-MDD。在L2-ARCTIC上,CoCA-MDD在流式模式和融合模式分别取得57.03%和60.78%的F1分数。对于音素级发音评分,CoCA-MDD在SpeechOcean762上取得0.58的皮尔逊相关系数(PCC)值。

关键词

引用

@article{arxiv.2111.08191,
  title  = {CoCA-MDD: A Coupled Cross-Attention based Framework for Streaming Mispronunciation Detection and Diagnosis},
  author = {Nianzu Zheng and Liqun Deng and Wenyong Huang and Yu Ting Yeung and Baohua Xu and Yuanyuan Guo and Yasheng Wang and Xiao Chen and Xin Jiang and Qun Liu},
  journal= {arXiv preprint arXiv:2111.08191},
  year   = {2022}
}

备注

5 pages, 4 figures, Accepted by INTERSPEECH 2022