中文

论频率维归一化以改善音频谱图Transformer的录音设备泛化能力

音频与语音处理 2023-06-22 v1 机器学习 声音

摘要

训练时与应用时的数据条件差异仍是机器学习的一大挑战。我们在录音设备不匹配情况下的声学场景分类(ASC)背景下研究该问题。先前工作成功在卷积神经网络中对输入和隐藏层激活进行频率维归一化,以减小录音设备差异。本工作的主要目标是将频率维归一化引入音频谱图Transformer(AST)——其近期已成为ASC中的主导模型架构。为此,我们首先探究录音设备特性如何编码于AST的隐藏层激活中。我们发现录音设备信息最初编码于频率维度;然而在经过第一个自注意力块后,其很大程度上转变为令牌维度。基于该观察,我们推测在输入谱图中抑制录音设备特性最为有效。我们提出一种谱图频率中心化操作,将未知录音设备上的ASC性能平均提升多达18.2个百分点。

关键词

引用

@article{arxiv.2306.11764,
  title  = {On Frequency-Wise Normalizations for Better Recording Device Generalization in Audio Spectrogram Transformers},
  author = {Paul Primus and and Gerhard Widmer},
  journal= {arXiv preprint arXiv:2306.11764},
  year   = {2023}
}

备注

EUSIPCO 2023