中文

基于注意力机制与 LSTM-RNN 的端到端说话人身高与年龄估计

声音 2021-01-14 v1 计算与语言 机器学习

摘要

利用声学特征自动估计说话人身高与年龄广泛用于人机交互、法证等目的。本工作中,我们提出一种使用注意力机制构建端到端架构以估计身高与年龄的新方法。该注意力机制与长短期记忆(LSTM)编码器结合,能够捕获输入声学特征中的长期依赖关系。我们修改了常规使用的注意力——其仅跨时间帧计算注意力的上下文向量之和——通过引入也考虑编码器单元间总注意力的修正上下文向量,给出了一种新的交叉注意力机制。除此之外,我们还研究了联合估计说话人身高与年龄的多任务学习方法。我们在 TIMIT 语料库上训练并测试模型。我们的模型优于文献中若干方法。我们对男性和女性身高分别取得 6.92 cm 和 6.34 cm 的均方根误差(RMSE),对男性和女性年龄分别取得 7.85 年和 8.75 年的 RMSE。通过追踪分配给不同音素的注意力权重,我们发现元音音素最重要,而哨音音素对该估计任务最不重要。

关键词

引用

@article{arxiv.2101.05056,
  title  = {End-to-End Speaker Height and age estimation using Attention Mechanism with LSTM-RNN},
  author = {Manav Kaushik and Van Tung Pham and Eng Siong Chng},
  journal= {arXiv preprint arXiv:2101.05056},
  year   = {2021}
}

备注

5 Pages