CT-SAT:用于序列音频标注的上下文 Transformer
声音
2022-03-23 v1 音频与语音处理
摘要
序列音频事件标注不仅能提供音频事件的类型信息,还能提供事件之间的顺序信息以及音频片段中发生的事件数量。先前关于音频事件序列分析的大多数工作依赖于连接主义时间分类 (CTC)。然而,CTC 的条件独立假设使其无法有效学习不同音频事件之间的相关性。本文首次尝试将 Transformer 引入序列音频标注,因为 Transformer 在序列相关任务中表现良好。为了更好地利用音频事件序列的上下文信息,我们借鉴双向循环神经网络的思想,提出了一种具有双向解码器的上下文 Transformer (cTransformer),该解码器能够利用事件序列的前向和后向信息。在真实复调音频数据集上的实验表明,与基于 CTC 的方法相比,cTransformer 能够有效结合来自编码器的细粒度声学表示和粗粒度音频事件线索,以利用上下文信息,从而成功识别和预测音频事件序列。
引用
@article{arxiv.2203.11573,
title = {CT-SAT: Contextual Transformer for Sequential Audio Tagging},
author = {Yuanbo Hou and Zhaoyi Liu and Bo Kang and Yun Wang and Dick Botteldooren},
journal= {arXiv preprint arXiv:2203.11573},
year = {2022}
}
备注
Submitted to interspeech 2022