局部信息辅助的无注意力解码器用于音频描述
声音
2022-08-10 v2 机器学习
音频与语音处理
摘要
自动化音频描述旨在利用自然语言对音频数据进行描述。现有方法常采用编码器-解码器结构,其中基于注意力的解码器(如 Transformer 解码器)被广泛使用并取得了最先进的性能。尽管该方法通过自注意力机制有效捕获了音频数据中的全局信息,但由于其在捕获音频信号局部信息方面的局限性,可能忽略短时长的事件,从而导致描述预测不准确。为解决此问题,我们提出一种方法,使用预训练音频神经网络(PANNs)作为编码器,并以局部信息辅助的无注意力 Transformer(LocalAFT)作为解码器。我们方法的新颖之处在于提出了 LocalAFT 解码器,其能够在保留全局信息的同时捕获音频信号中的局部信息。这使得不同时长(包括短时长)的事件都能被捕获,从而生成更精确的描述。实验表明,在 DCASE 2021 挑战赛的任务 6 中,我们的方法优于使用标准基于注意力的解码器进行描述生成的最先进方法。
引用
@article{arxiv.2201.03217,
title = {Local Information Assisted Attention-free Decoder for Audio Captioning},
author = {Feiyang Xiao and Jian Guan and Haiyan Lan and Qiaoxi Zhu and Wenwu Wang},
journal= {arXiv preprint arXiv:2201.03217},
year = {2022}
}
备注
Accepted by IEEE Signal Processing Letters