音频描述 Transformer
音频与语音处理
2021-07-22 v1 机器学习
声音
摘要
音频描述旨在自动生成音频片段的自然语言描述。大多数描述模型遵循编码器-解码器架构,其中解码器基于编码器提取的音频特征预测词语。卷积神经网络(CNN)和循环神经网络(RNN)常被用作音频编码器。然而,CNN 在建模音频信号中各时间帧之间的时间关系上可能受限,而 RNN 在建模时间帧间的长程依赖上可能受限。在本文中,我们提出了 Audio Captioning Transformer(ACT),这是一种基于编码器-解码器架构的全 Transformer 网络,且完全无卷积。所提方法具有更好的能力来建模音频信号内的全局信息以及捕捉音频事件间的时间关系。我们在 AudioCaps 上评估了我们的模型,这是公开可用的最大音频描述数据集。我们的模型与其他最先进方法相比表现出具有竞争力的性能。
引用
@article{arxiv.2107.09817,
title = {Audio Captioning Transformer},
author = {Xinhao Mei and Xubo Liu and Qiushi Huang and Mark D. Plumbley and Wenwu Wang},
journal= {arXiv preprint arXiv:2107.09817},
year = {2021}
}
备注
5 pages, 1 figure