SHMamba:面向音视频问答的结构化双曲状态空间模型
人工智能
2024-07-17 v3 多媒体
声音
音频与语音处理
摘要
音视频问答(AVQA)任务具有广阔的应用前景。与传统单模态方法相比,AVQA的多模态输入使得特征提取和融合过程更加具有挑战性。欧几里得空间难以有效表示数据的多维关系。尤其在提取和处理具有树状或层次结构的数据时,欧几里得空间并不适合作为嵌入空间。此外,Transformer中的自注意力机制在捕捉序列中元素之间的动态关系方面效果良好。然而,自注意力机制在窗口建模和二次计算复杂度方面的局限性,降低了其在建模长序列时的效果。为解决这些限制,我们提出了SHMamba:结构化双曲状态空间模型,以整合双曲几何与状态空间模型优势。具体而言,SHMamba利用双曲空间的内在属性来表示音视频数据中的层次结构和复杂关系。同时,状态空间模型通过全局建模整个序列来捕捉随时间的动态变化。进一步,我们引入了自适应曲率双曲对齐模块和跨融合块,以增强对层次结构的理解和跨模态信息的动态交换。大量实验表明,SHMamba在更少的参数和计算成本下超越了之前的方法。我们的可学习参数减少了78.12\%,平均性能提升2.53\%。实验表明,该方法在所有当前主要方法中均表现出优势,更适用于实际应用场景。
引用
@article{arxiv.2406.09833,
title = {SHMamba: Structured Hyperbolic State Space Model for Audio-Visual Question Answering},
author = {Zhe Yang and Wenrui Li and Guanghui Cheng},
journal= {arXiv preprint arXiv:2406.09833},
year = {2024}
}