中文

利用SSW60数据集探索细粒度视听分类

计算机视觉与模式识别 2022-07-22 v1 机器学习

摘要

我们提出一个新的基准数据集Sapsucker Woods 60(SSW60),以推进视听细粒度分类的研究。尽管我们的社区在图像细粒度视觉分类方面取得了巨大进展,但音频和视频细粒度分类的对应研究相对未被探索。为鼓励该领域的进展,我们精心构建了SSW60数据集,使研究人员能够使用三种不同模态——图像、音频和视频——对同一组类别进行分类实验。该数据集涵盖60种鸟类,由现有数据集中的图像以及全新的、专家策划的音频和视频数据集组成。我们通过使用最先进的transformer方法,对视听分类性能和模态融合实验进行了充分基准测试。我们的发现表明,在视频分类任务中,视听融合方法的性能优于仅使用基于图像或音频的方法。我们还展示了有趣的模态迁移实验,这得益于SSW60涵盖三种不同模态的独特构建。我们希望SSW60数据集及 accompanying 基线能激发这一迷人领域的研究。

关键词

引用

@article{arxiv.2207.10664,
  title  = {Exploring Fine-Grained Audiovisual Categorization with the SSW60 Dataset},
  author = {Grant Van Horn and Rui Qian and Kimberly Wilber and Hartwig Adam and Oisin Mac Aodha and Serge Belongie},
  journal= {arXiv preprint arXiv:2207.10664},
  year   = {2022}
}

备注

ECCV 2022 Camera Ready