变速率离散表示学习
机器学习
2021-03-11 v1 计算与语言
声音
音频与语音处理
摘要
感知信号中语义有意义的信息内容通常分布不均。例如在语音信号中,常常存在大量静音,且发音速度可能差异显著。本工作中,我们提出慢速自编码器(SlowAEs)用于序列高层变速率离散表示的无监督学习,并将其应用于语音。我们表明,所得到的基于事件的表示会根据输入信号中显著信息的密度自动增长或收缩,同时仍允许对信号进行忠实重构。我们开发了游程长度Transformer(RLTs)用于基于事件的表示建模,并用它们构建语音领域的语言模型,这些模型能够生成符合语法且语义连贯的语句与续写。
引用
@article{arxiv.2103.06089,
title = {Variable-rate discrete representation learning},
author = {Sander Dieleman and Charlie Nash and Jesse Engel and Karen Simonyan},
journal= {arXiv preprint arXiv:2103.06089},
year = {2021}
}
备注
26 pages, 15 figures, samples can be found at https://vdrl.github.io/