基于迁移学习联合优化策略的视听场景分类
计算机视觉与模式识别
2022-04-26 v1 多媒体
声音
音频与语音处理
摘要
近年来,视听场景分类(AVSC)引起了多学科领域的日益关注。以往研究倾向于采用流水线训练策略,即先使用训练好的视觉与声学编码器提取高层表示(嵌入),再利用这些表示训练视听分类器。这种方式提取的嵌入非常适合单模态分类器,但不一定适合多模态分类器。本文提出一种联合训练框架,直接将声学特征与原始图像作为 AVSC 任务的输入。具体而言,我们取预训练图像模型的底层作为视觉编码器,并在训练过程中联合优化场景分类器与基于 1D-CNN 的声学编码器。我们在 TAU Urban Audio-Visual Scenes 2021 的开发集上评估该方法。实验结果表明,所提方法相较传统流水线训练策略取得显著提升。此外,我们的最佳单系统优于以往 SOTA 方法,在官方测试折上取得 0.1517 的对数损失与 94.59% 的准确率。
引用
@article{arxiv.2204.11420,
title = {Audio-Visual Scene Classification Using A Transfer Learning Based Joint Optimization Strategy},
author = {Chengxin Chen and Meng Wang and Pengyuan Zhang},
journal= {arXiv preprint arXiv:2204.11420},
year = {2022}
}
备注
5 pages, 2 figures, based on the work that won first place in the challenge of DCASE2021 Task 1B