基于空间对齐的视听数据自监督音频表示学习
音频与语音处理
2022-11-23 v1 声音
摘要
从视听数据中学习提供了许多表达音频与视觉内容之间对应关系的途径,类似于人类将听觉与视觉信息相关联的感知。在本工作中,我们提出一种基于视听空间对齐(AVSA)的自监督表示学习方法,该任务比视听对应(AVC)更为复杂。除对应外,AVSA还从声学内容与视觉内容的空间位置中学习。基于360°视频与Ambisonics音频,我们提出利用目标检测选取视觉对象,并对音频信号朝向检测到的对象进行波束成形,试图学习对象与其产生的声音之间的空间对齐。我们研究了使用空间音频特征表示音频输入,以及不同音频格式:Ambisonics、单声道与立体声。实验结果显示,与log-mel谱图特征相比,一阶Ambisonics强度向量(FOA-IV)在AVSA上提升了10%;面向对象的裁剪也为人体动作识别下游任务带来显著性能提升。我们设计了若干仅音频下游任务以测试所学音频特征表示的有效性,在基于Ambisonics与双耳音频的声学场景分类上取得了与最先进方法相当的性能。
引用
@article{arxiv.2206.00970,
title = {Self-supervised Learning of Audio Representations from Audio-Visual Data using Spatial Alignment},
author = {Shanshan Wang and Archontis Politis and Annamaria Mesaros and Tuomas Virtanen},
journal= {arXiv preprint arXiv:2206.00970},
year = {2022}
}