利用多目标自回归预测编码改进语音表征
音频与语音处理
2020-04-14 v1 计算与语言
机器学习
声音
摘要
基于预测编码的训练目标近来被证明能非常有效地从无标注语音中学习有意义的表征。一个例子是自回归预测编码 (Chung et al., 2019),其训练一个自回归 RNN 在给定如近期过去帧的上下文时生成未见未来帧。这些方法的基本假设是,能准确预测未来帧的隐藏状态对许多下游任务是有用的表征。本文中我们扩展该假设,旨在通过训练模型做出更准确的未来预测来丰富隐藏状态中编码的信息。我们提出一个辅助目标,作为正则化以改善未来帧预测任务的泛化。在音素分类、语音识别与语音翻译上的实验结果不仅支持该假设,也展示了我们的方法在学习含更丰富音素内容的表征上的有效性。
引用
@article{arxiv.2004.05274,
title = {Improved Speech Representations with Multi-Target Autoregressive Predictive Coding},
author = {Yu-An Chung and James Glass},
journal= {arXiv preprint arXiv:2004.05274},
year = {2020}
}
备注
Accepted to ACL 2020