中文

用于声音事件定位与检测的DOA感知音视频自监督学习

声音 2024-10-31 v1 人工智能 机器学习 多媒体 音频与语音处理

摘要

本文描述了针对一阶高保真度立体声响复制(FOA)麦克风捕获的空间音频录音的声音事件定位与检测(SELD)。在此任务中,可以使用标注了声音事件类别和到达方向(DOA)的FOA数据来训练深度神经网络(DNN)。然而,这种方法的性能严重受限于标注数据的数量。为了克服这一限制,我们提出了一种以自监督方式预训练DNN特征提取部分的新方法。我们使用作为虚拟现实内容大量可用的空间音视频录音。假设声音对象被FOA麦克风和全向相机同时观测到,我们通过对比学习联合训练音频和视频编码器,使得同一录音和DOA的音频与视频嵌入彼此接近。我们方法的一个关键特征是,DOA感知的音频嵌入是从原始音频数据中联合提取的,而DOA感知的视频嵌入则是从以相应DOA为中心的局部视频裁剪中分别提取的。这鼓励音频编码器的潜在特征同时表示声音事件的类别和DOA。使用20小时的DCASE2022 Task 3数据集进行的实验表明,100小时的无标注音视频录音将SELD的错误分数从36.4分降低到34.9分。

关键词

引用

@article{arxiv.2410.22803,
  title  = {DOA-Aware Audio-Visual Self-Supervised Learning for Sound Event Localization and Detection},
  author = {Yoto Fujita and Yoshiaki Bando and Keisuke Imoto and Masaki Onishi and Kazuyoshi Yoshii},
  journal= {arXiv preprint arXiv:2410.22803},
  year   = {2024}
}

备注

Accepted to APSIPA2023