利用相位和幅度连续性先验学习的自然声音稀疏复值表示
机器学习
2014-02-19 v3 声音
神经元与认知
摘要
复值稀疏编码是一种数据表示方法,它采用二维子空间字典,同时对复振幅施加稀疏的因子化先验。当在自然图像块数据集上训练时,它学习到的相位不变特征与视觉皮层中复杂细胞的感受野非常相似。然而,在自然声音上训练的特征很少表现出相位不变性,而是捕捉了数据的其他方面。这一观察是本工作的起点。作为第一个贡献,它通过学习短语音间隔的稀疏复表示来分析自然声音统计特性。其次,它提出了针对基函数集的先验,使其偏向于相位不变解。通过这种方式,可以从数据统计中学习复基函数字典,同时保持相位不变性。最后,比较了在有无先验条件下训练出的语音声音表示。基于先验的基函数表现出与无约束稀疏编码相当的性能,同时显式地将相位表示为时间平移。此类表示可应用于许多感知和机器学习任务。
引用
@article{arxiv.1312.4695,
title = {Sparse, complex-valued representations of natural sounds learned with phase and amplitude continuity priors},
author = {Wiktor Mlynarski},
journal= {arXiv preprint arXiv:1312.4695},
year = {2014}
}
备注
11 + 7 pages This version includes changes suggested by ICLR 2014 reviewers