中文

Epic-Sounds:一个大规模的有声动作数据集

声音 2025-07-17 v3 人工智能 机器学习 音频与语音处理

摘要

我们介绍 EPIC-SOUNDS,一个大规模音频标注数据集,捕获以自我为中心视频的音频流中的时间范围和类别标签。我们提出一个标注流程,标注者按时间标记可区分的音频片段并描述可能导致该声音的动作。我们通过将这些音频的自由形式描述分组为类别,识别出可纯从音频判别的动作。对于涉及物体碰撞的动作,我们收集这些物体材质的人工标注(例如玻璃物体被放置在木质表面上),并从视频中核实,丢弃歧义。总体而言,EPIC-SOUNDS 包含 78.4k 个已分类的可听事件与动作片段,分布于 44 个类别,以及 39.2k 个未分类片段。我们在我们的数据集上训练和评估了 SOTA 音频识别与检测模型,涵盖仅音频和音视觉方法。我们还分析了:音频事件间的时间重叠、音频与视觉模态间的时间和标签相关性、仅从音频输入标注材质的歧义、仅音频标签的重要性,以及当前模型理解有声动作的局限性。

关键词

引用

@article{arxiv.2302.00646,
  title  = {Epic-Sounds: A Large-scale Dataset of Actions That Sound},
  author = {Jaesung Huh and Jacob Chalk and Evangelos Kazakos and Dima Damen and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2302.00646},
  year   = {2025}
}

备注

Accepted at TPAMI