中文

语音处理中的深度表示学习:挑战、近期进展与未来趋势

声音 2021-09-27 v2 机器学习 音频与语音处理

摘要

语音处理的研究传统上将设计手工声学特征(特征工程)的任务与设计高效机器学习(ML)模型以进行预测和分类决策的任务视为两个独立的问题。这种方法有两个主要缺点:首先,特征工程依赖人工,繁琐且需要人类知识;其次,所设计的特征未必最适合当前目标。这促使语音界近期倾向于采用表示学习技术,其可自动学习输入信号的中间表示,从而更好地适应手头任务并带来性能提升。随着深度学习(DL)的发展,表示学习的重要性日益增加,其所学表示更有用且更少依赖人类知识,非常有利于分类、预测等任务。本文的主要贡献是通过汇集自动语音识别(ASR)、说话人识别(SR)和说话人情绪识别(SER)这三个不同研究领域中分散的工作,对不同的语音表示学习技术进行最新且全面的综述。已有针对 ASR、SR 和 SER 的近期综述,但均未聚焦于从语音中进行表示学习——这正是本综述旨在弥补的空白。

关键词

引用

@article{arxiv.2001.00378,
  title  = {Deep Representation Learning in Speech Processing: Challenges, Recent Advances, and Future Trends},
  author = {Siddique Latif and Rajib Rana and Sara Khalifa and Raja Jurdak and Junaid Qadir and Björn W. Schuller},
  journal= {arXiv preprint arXiv:2001.00378},
  year   = {2021}
}

备注

Part of this work is accepted in IEEE Transactions on Affective Computing 2021. https://ieeexplore.ieee.org/document/9543566