中文

深度 ASR 性能预测模型所学表征的分析

计算与语言 2018-08-29 v2

摘要

本文探讨一个相对新颖的任务:对未见广播节目的 ASR 性能进行预测。在先前论文中,我们提出了一个使用 CNN 编码文本(ASR 转写文本)与语音以预测词错误率的 ASR 性能预测系统。本工作致力于分析训练预测模型时 CNN 所学的语音信号嵌入与文本嵌入。我们试图更好地理解深度模型捕获了哪些信息及其与不同条件因素的关系。研究表明,隐藏层传递了关于语音风格、口音和广播类型的清晰信号。我们随后尝试在多任务学习中于训练时利用这三类信息。实验表明,这使得能够训练稍高效的 ASR 性能预测系统,且——此外——能同时根据语音风格、口音和广播节目来源对分析的语句进行标注。

关键词

引用

@article{arxiv.1808.08573,
  title  = {Analyzing Learned Representations of a Deep ASR Performance Prediction Model},
  author = {Zied Elloumi and Laurent Besacier and Olivier Galibert and Benjamin Lecouteux},
  journal= {arXiv preprint arXiv:1808.08573},
  year   = {2018}
}

备注

EMNLP 2018 Workshop