用于自动音频字幕的图注意力
声音
2023-04-11 v2 音频与语音处理
摘要
最先进的音频字幕方法通常采用编码器-解码器结构,并使用预训练音频神经网络(PANNs)作为编码器进行特征提取。然而,PANNs 中使用的卷积操作在捕获音频信号内的长时间依赖方面存在局限,从而导致音频字幕中潜在的性能下降。本文提出一种基于编码器-解码器音频字幕的图注意力新方法(GraphAC)。在编码器中,于 PANNs 之后引入图注意力模块,通过邻接图学习上下文关联(即不同时间帧上音频特征间的依赖),并使用 top-k 掩码减轻来自噪声节点的干扰。学到的上下文关联通过特征节点聚合得到更有效的特征表示。因此,解码器可基于从音频信号中学到的上下文关联预测关于声学场景与事件的重要语义信息。实验结果表明,由于将图注意力模块引入编码器以捕获音频信号内的长时间依赖,GraphAC 优于以 PANNs 为编码器的最先进方法。源代码见 https://github.com/LittleFlyingSheep/GraphAC。
引用
@article{arxiv.2304.03586,
title = {Graph Attention for Automated Audio Captioning},
author = {Feiyang Xiao and Jian Guan and Qiaoxi Zhu and Wenwu Wang},
journal= {arXiv preprint arXiv:2304.03586},
year = {2023}
}
备注
Accepted by IEEE Signal Processing Letters