中文

基于多方面注意力的层次化发音评估

计算与语言 2023-05-29 v2 声音 音频与语音处理

摘要

自动发音评估是计算机辅助发音训练系统的主要组成部分。为提供深入反馈,在音素、词和话语等多种粒度层次上,就准确性、流利度和完整度等不同方面对发音进行打分至关重要。然而,现有的多方面多粒度方法同时预测所有粒度层次上的所有方面,因而难以捕捉音素、词和话语的语言学层次结构。这一局限进一步导致忽略同一语言单元上紧密的跨方面关联。本文中,我们提出一种基于多方面注意力的层次化发音评估(HiPAMA)模型,该模型层次化表示粒度层次以直接捕捉其语言结构,并引入多方面注意力以反映同一层次上跨方面的关联,从而构建更具内涵的表示。通过从粒度和方面两侧获取关联信息,HiPAMA 可充分利用多任务学习。在 speachocean762 数据集上的实验结果所取得的显著改进证明了 HiPAMA 的鲁棒性,尤其在难以评估的方面上。

关键词

引用

@article{arxiv.2211.08102,
  title  = {Hierarchical Pronunciation Assessment with Multi-Aspect Attention},
  author = {Heejin Do and Yunsu Kim and Gary Geunbae Lee},
  journal= {arXiv preprint arXiv:2211.08102},
  year   = {2023}
}

备注

Accepted at ICASSP 2023