中文

用于结构感知音视觉场景分类的注意力图卷积网络

计算机视觉与模式识别 2023-01-03 v1

摘要

音视觉场景理解是一项具有挑战性的问题,原因在于声音信号中存在非结构化的时空关系,以及视觉图像中不同物体空间布局与各种纹理模式。近来许多研究聚焦于从卷积神经网络抽取特征,而显式语义相关声音信号帧与视觉图像的学习被忽视。为此,我们提出一个端到端框架,即注意力图卷积网络(AGCN),用于结构感知的音视觉场景表征。首先,声音与输入图像的谱图由骨干网络处理以提取特征。然后,为构建输入特征的多尺度层次信息,我们利用注意力融合机制聚合骨干网络多层特征。值得注意的是,为良好表征音视觉输入的显著区域与上下文信息,我们构建显著声学图(SAG)、上下文声学图(CAG)、显著视觉图(SVG)与上下文视觉图(CVG)用于音视觉场景表征。最后,所构建图通过图卷积网络以进行结构感知的音视觉场景识别。在音频、视觉及音视觉场景识别数据集上的大量实验结果表明,AGCN 方法取得了有前景的结果。我们在谱图与图像上可视化图以展示所提 CAG/SAG 与 CVG/SVG 能聚焦于显著及语义相关区域的有效性。

关键词

引用

@article{arxiv.2301.00145,
  title  = {Attentional Graph Convolutional Network for Structure-aware Audio-Visual Scene Classification},
  author = {Liguang Zhou and Yuhongze Zhou and Xiaonan Qi and Junjie Hu and Tin Lun Lam and Yangsheng Xu},
  journal= {arXiv preprint arXiv:2301.00145},
  year   = {2023}
}