中文

AudioInceptionNeXt:TCL AI LAB 提交至 EPIC-SOUND 2023 基于音频的交互识别挑战赛的方案

声音 2023-07-17 v1 人工智能 音频与语音处理

摘要

本报告介绍了我们提交至 2023 Epic-Kitchen EPIC-SOUNDS 基于音频的交互识别挑战赛的技术细节。任务是从音频样本学习到其对应动作标签的映射。为实现该目标,我们提出了一种简洁而有效的基于单流 CNN 的架构 AudioInceptionNeXt,其作用于音频样本的时频 log-mel 谱图。受 InceptionNeXt 设计的启发,我们在 AudioInceptionNeXt 模块中提出并行多尺度深度可分离卷积核,使模型能更有效地学习时间与频率信息。大尺度可分离卷积核捕获活动的长时长与全局频率语义信息,而小尺度可分离卷积核捕获活动的短时长与频率信息的局部细节。我们的方法在挑战赛测试集上取得了 55.43% 的 top-1 准确率,在公开排行榜上排名第 1。代码匿名发布于 https://github.com/StevenLauHKHK/AudioInceptionNeXt.git。

关键词

引用

@article{arxiv.2307.07265,
  title  = {AudioInceptionNeXt: TCL AI LAB Submission to EPIC-SOUND Audio-Based-Interaction-Recognition Challenge 2023},
  author = {Kin Wai Lau and Yasar Abbas Ur Rehman and Yuyang Xie and Lan Ma},
  journal= {arXiv preprint arXiv:2307.07265},
  year   = {2023}
}