AudioInceptionNeXt:TCL AI LAB 提交至 EPIC-SOUND 2023 基于音频的交互识别挑战赛的方案
声音
2023-07-17 v1 人工智能
音频与语音处理
摘要
本报告介绍了我们提交至 2023 Epic-Kitchen EPIC-SOUNDS 基于音频的交互识别挑战赛的技术细节。任务是从音频样本学习到其对应动作标签的映射。为实现该目标,我们提出了一种简洁而有效的基于单流 CNN 的架构 AudioInceptionNeXt,其作用于音频样本的时频 log-mel 谱图。受 InceptionNeXt 设计的启发,我们在 AudioInceptionNeXt 模块中提出并行多尺度深度可分离卷积核,使模型能更有效地学习时间与频率信息。大尺度可分离卷积核捕获活动的长时长与全局频率语义信息,而小尺度可分离卷积核捕获活动的短时长与频率信息的局部细节。我们的方法在挑战赛测试集上取得了 55.43% 的 top-1 准确率,在公开排行榜上排名第 1。代码匿名发布于 https://github.com/StevenLauHKHK/AudioInceptionNeXt.git。
引用
@article{arxiv.2307.07265,
title = {AudioInceptionNeXt: TCL AI LAB Submission to EPIC-SOUND Audio-Based-Interaction-Recognition Challenge 2023},
author = {Kin Wai Lau and Yasar Abbas Ur Rehman and Yuyang Xie and Lan Ma},
journal= {arXiv preprint arXiv:2307.07265},
year = {2023}
}