用于大规模弱标注音频事件分类与同步的音视频Transformer架构
音频与语音处理
2019-12-06 v1 机器学习
声音
机器学习
摘要
我们通过借鉴机器翻译中使用的transformer神经网络架构来解决环境事件分类任务。我们修改这一基于注意力的前馈结构,使所得模型能够利用音频与视频计算声音事件预测。我们在一个音视频数据集上对这些改进的transformer进行了大量实验,该数据集是通过向现有大规模弱标注音频集合附加相关视觉信息得到的。所采用的多标签数据包含指示17类环境声音存在与否的片段级标注,且不包含时间信息。我们表明,所提出的改进transformer大幅优于先前引入的模型,并实际上取得了最先进的结果。我们还通过证明视觉信息对当前任务(即音频事件识别)的有用性,有力地论证了应更多关注多模态音视频分类研究。此外,我们可视化了音视频transformer的内部注意力模式,并由此展示了它们在执行多模态同步方面的潜力。
引用
@article{arxiv.1912.02615,
title = {Audiovisual Transformer Architectures for Large-Scale Classification and Synchronization of Weakly Labeled Audio Events},
author = {Wim Boes and Hugo Van hamme},
journal= {arXiv preprint arXiv:1912.02615},
year = {2019}
}