基于多方面注意力的层次化发音评估
计算与语言
2023-05-29 v2 声音
音频与语音处理
摘要
自动发音评估是计算机辅助发音训练系统的主要组成部分。为提供深入反馈,在音素、词和话语等多种粒度层次上,就准确性、流利度和完整度等不同方面对发音进行打分至关重要。然而,现有的多方面多粒度方法同时预测所有粒度层次上的所有方面,因而难以捕捉音素、词和话语的语言学层次结构。这一局限进一步导致忽略同一语言单元上紧密的跨方面关联。本文中,我们提出一种基于多方面注意力的层次化发音评估(HiPAMA)模型,该模型层次化表示粒度层次以直接捕捉其语言结构,并引入多方面注意力以反映同一层次上跨方面的关联,从而构建更具内涵的表示。通过从粒度和方面两侧获取关联信息,HiPAMA 可充分利用多任务学习。在 speachocean762 数据集上的实验结果所取得的显著改进证明了 HiPAMA 的鲁棒性,尤其在难以评估的方面上。
引用
@article{arxiv.2211.08102,
title = {Hierarchical Pronunciation Assessment with Multi-Aspect Attention},
author = {Heejin Do and Yunsu Kim and Gary Geunbae Lee},
journal= {arXiv preprint arXiv:2211.08102},
year = {2023}
}
备注
Accepted at ICASSP 2023