中文

语音的认知编码

音频与语音处理 2021-10-11 v1 机器学习

摘要

我们提出一种通过无监督提取两个抽象层级上的上下文表示来实现语音认知编码的方法。持续一百毫秒或更短时间的语音属性(如音素身份)在较低抽象层级中被捕获,而持续长达一秒的语音属性(如说话人身份与情绪)在较高抽象层级中被捕获。该分解由一个两阶段神经网络实现,其下阶段与上阶段以不同时间尺度运行。两个阶段均被训练以在其各自潜空间中预测信号内容。阶段间的自顶向下通路进一步提升了网络的预测能力。考虑到在语音压缩中的应用,我们研究了降维与低比特率量化对提取表示的影响。在 LibriSpeech 与 EmoV-DB 数据集上测得的性能达到、且对某些语音属性甚至超越了最先进方法的水平。

关键词

引用

@article{arxiv.2110.04241,
  title  = {Cognitive Coding of Speech},
  author = {Reza Lotfidereshgi and Philippe Gournay},
  journal= {arXiv preprint arXiv:2110.04241},
  year   = {2021}
}