中文

利用相位和幅度连续性先验学习的自然声音稀疏复值表示

机器学习 2014-02-19 v3 声音 神经元与认知

摘要

复值稀疏编码是一种数据表示方法,它采用二维子空间字典,同时对复振幅施加稀疏的因子化先验。当在自然图像块数据集上训练时,它学习到的相位不变特征与视觉皮层中复杂细胞的感受野非常相似。然而,在自然声音上训练的特征很少表现出相位不变性,而是捕捉了数据的其他方面。这一观察是本工作的起点。作为第一个贡献,它通过学习短语音间隔的稀疏复表示来分析自然声音统计特性。其次,它提出了针对基函数集的先验,使其偏向于相位不变解。通过这种方式,可以从数据统计中学习复基函数字典,同时保持相位不变性。最后,比较了在有无先验条件下训练出的语音声音表示。基于先验的基函数表现出与无约束稀疏编码相当的性能,同时显式地将相位表示为时间平移。此类表示可应用于许多感知和机器学习任务。

关键词

引用

@article{arxiv.1312.4695,
  title  = {Sparse, complex-valued representations of natural sounds learned with phase and amplitude continuity priors},
  author = {Wiktor Mlynarski},
  journal= {arXiv preprint arXiv:1312.4695},
  year   = {2014}
}

备注

11 + 7 pages This version includes changes suggested by ICLR 2014 reviewers