中文

通过批量嵌入协方差正则化与 Constant-Q 变换学习广义音频表示的途径

声音 2023-03-08 v1 机器学习 多媒体 音频与语音处理

摘要

通用嵌入在许多应用场景(包括音频任务)中对于少样本乃至零样本学习极为可取。为了更好地理解表示,我们对 HEAR 2021 提交结果进行了详尽的误差分析与可视化。受该分析启发,本工作实验了不同的前端音频预处理方法,包括 Constant-Q Transform (CQT) 与 Short-time Fourier transform (STFT),并提出了批量嵌入协方差正则化(BECR)项,以揭示对人类听觉系统所接收频率信息更整体的模拟。我们在 HEAR 2021 任务套件上测试了模型,该套件涵盖广泛类别的任务。初步结果表明:(1) 所提 BECR 可在测试集上引发更分散的嵌入;(2) BECR 在不增加计算复杂度的前提下改进了 PaSST 模型;(3) 在我们测试的所有任务中,STFT 预处理优于 CQT。Github:https://github.com/ankitshah009/general_audio_embedding_hear_2021

关键词

引用

@article{arxiv.2303.03591,
  title  = {Approach to Learning Generalized Audio Representation Through Batch Embedding Covariance Regularization and Constant-Q Transforms},
  author = {Ankit Shah and Shuyi Chen and Kejun Zhou and Yue Chen and Bhiksha Raj},
  journal= {arXiv preprint arXiv:2303.03591},
  year   = {2023}
}

备注

Technical report, 10 pages