中文

面向序列数据的深度自编码预测分量表示学习

机器学习 2021-03-02 v2

摘要

我们提出深度自编码预测分量(DAPC)——一种针对序列数据的自监督表示学习方法,其出发点是:序列数据的有用表示应在潜空间中呈现出简单的结构。我们通过最大化潜特征序列预测信息的估计值来鼓励这种潜空间结构,该预测信息即每个时间步上过去与未来窗口之间的互信息。与对比学习常用的互信息下界不同,我们所采用的预测信息估计在高斯假设下是精确的,且无需负采样即可计算。为缓解强大编码器所提取潜空间的退化并保留输入中的有用信息,我们以具有挑战性的掩码重构损失对预测信息学习进行正则化。我们证明,该方法能够恢复含噪动力系统的潜空间、为预测任务提取预测性特征,并在使用大量无标签数据预训练编码器时改善自动语音识别性能。

关键词

引用

@article{arxiv.2010.03135,
  title  = {Representation Learning for Sequence Data with Deep Autoencoding Predictive Components},
  author = {Junwen Bai and Weiran Wang and Yingbo Zhou and Caiming Xiong},
  journal= {arXiv preprint arXiv:2010.03135},
  year   = {2021}
}