中文

用于音视觉场景分类的多源 Transformer 架构

音频与语音处理 2022-10-20 v1 计算机视觉与模式识别 声音 图像与视频处理

摘要

在本技术报告中,我们详细描述了为 DCASE 2021 挑战赛子任务 1B(关于音视觉场景分类)所提交的系统。它们本质上是采用听觉与视觉特征组合进行预测的多源 Transformer。这些模型利用宏平均多类交叉熵与准确率指标进行评估。就宏平均多类交叉熵而言,我们最佳模型在验证数据上取得了 0.620 的分数,略优于基线系统(0.658)。就准确率指标而言,我们最佳模型在验证数据上取得了 77.1\% 的分数,与基线系统所取得的性能(77.0\%)大致相同。

关键词

引用

@article{arxiv.2210.10212,
  title  = {Multi-Source Transformer Architectures for Audiovisual Scene Classification},
  author = {Wim Boes and Hugo Van hamme},
  journal= {arXiv preprint arXiv:2210.10212},
  year   = {2022}
}

备注

Technical report of submission to DCASE 2021 Challenge Task 1B