GCT:用于序列音频标注的门控上下文Transformer
声音
2022-10-25 v1 音频与语音处理
摘要
音频标注旨在为音频片段分配预定义标签以指示音频事件的类别信息。序列音频标注(SAT)意味着同时检测音频事件的类别信息及其在音频片段中发生的顺序。现有大多数SAT方法基于连接主义时序分类(CTC)。然而,由于不同时刻输出间的条件独立假设,CTC无法有效捕捉事件间的关联。上下文Transformer(cTransformer)通过利用SAT中的上下文信息解决了该问题。但cTransformer在利用上下文信息上同样受限,因其推理时仅使用前向信息。本文提出一种带有前向-后向推理(FBI)的门控上下文Transformer(GCT)。此外,GCT中提出了门控上下文多层感知机(GCMLP)模块,从结构上提升cTransformer性能。在两个真实音频数据集上的实验表明,所提出的带GCMLP和FBI的GCT优于基于CTC的方法与cTransformer。为促进SAT研究,我们发布了这两个数据集的人工标注序列标签。
引用
@article{arxiv.2210.12541,
title = {GCT: Gated Contextual Transformer for Sequential Audio Tagging},
author = {Yuanbo Hou and Yun Wang and Wenwu Wang and Dick Botteldooren},
journal= {arXiv preprint arXiv:2210.12541},
year = {2022}
}