中文

AudioPairBank:迈向基于标签对的大规模音频内容分析

声音 2018-01-10 v3 计算与语言

摘要

最近,声音识别已被用于识别诸如汽车与河流等声音。然而,声音具有一些细微差别,这些细微差别或许能更好地由形容词-名词对(如 slow car)和动词-名词对(如 flying insects)来描述,而这一领域尚待深入探索。因此,在本工作中,我们研究了音频内容与形容词-名词对及动词-名词对之间的关系。由于缺乏带有此类标注的数据集,我们收集并处理了 AudioPairBank 语料库,其中包含合计 1,123 个标签对以及超过 33,000 个音频文件。一项贡献是此前缺失的关于收集带有此类标签的音频录音所面临挑战与影响的记录。第二项贡献是通过声音识别实验展示了音频内容与标签之间的相关程度,其实验结果达到了 70% 的准确率,从而也提供了一个性能基准。本文的结果与研究鼓励对音频中的细微差别进行进一步探索,并旨在补充多媒体分析中对图像与文本进行的类似研究。

关键词

引用

@article{arxiv.1607.03766,
  title  = {AudioPairBank: Towards A Large-Scale Tag-Pair-Based Audio Content Analysis},
  author = {Sebastian Sager and Benjamin Elizalde and Damian Borth and Christian Schulze and Bhiksha Raj and Ian Lane},
  journal= {arXiv preprint arXiv:1607.03766},
  year   = {2018}
}

备注

This paper is a revised version of "AudioSentibank: Large-scale Semantic Ontology of Acoustic Concepts for Audio Content Analysis"