中文

用于电影中音视觉声音事件检测的数据集

音频与语音处理 2023-02-16 v1 机器学习 声音

摘要

音频事件检测是一项被广泛研究的音频处理任务,其应用涵盖从自动驾驶汽车到医疗保健等领域。Audioset 等真实场景数据集推动了该领域的研究。然而,许多工作通常涉及人工标注与核验,难以大规模开展且成本高昂。电影刻画了各种现实与虚构场景,使其成为挖掘广泛音频事件的丰富资源。本文提出一个名为字幕对齐电影声音 (Subtitle-Aligned Movie Sounds, SAM-S) 的音频事件数据集。我们利用公开可用的闭路字幕转写文本,从 430 部电影中自动挖掘超过 11 万条音频事件。我们识别出分类音频事件的三个维度:声音、来源、质量,并给出生成最终包含 245 种声音的分类体系的过程。我们讨论了生成该分类体系时的取舍,并强调数据集中以人为中心的声音特性。我们建立了仅音频声音分类的基线性能为 34.76% 平均精度均值,并表明引入视觉信息可进一步提升约 5% 的性能。数据与代码已发布于 https://github.com/usc-sail/mica-subtitle-aligned-movie-sounds 供研究使用。

关键词

引用

@article{arxiv.2302.07315,
  title  = {A dataset for Audio-Visual Sound Event Detection in Movies},
  author = {Rajat Hebbar and Digbalay Bose and Krishna Somandepalli and Veena Vijai and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2302.07315},
  year   = {2023}
}