中文

多模态场景图与Kolmogorov-Arnold专家用于音视频问答

人工智能 2025-12-01 v1

摘要

本文提出一种 novel 方法——多模态场景图与Kolmogorov-Arnold专家网络,用于音视频问答(SHRIKE)。该任务旨在模仿人类推理,从音视频场景中提取和融合信息,主要挑战在于从复杂的音视频内容中识别与问题相关的线索。现有方法未能捕捉视频中的结构信息,且在多模态特征的细粒度建模方面表现不足。为此,我们首次引入一种新的多模态场景图,显式地将对象及其关系建模为一种视觉 grounding 的结构化音视频场景表示。此外,我们设计了一种基于Kolmogorov-Arnold网络(KAN)的混合专家(MoE)网络,以增强时间整合阶段的表达能力。这使得更精细地建模问题感知的跨模态音视频表示,捕获更丰富、更细致的模式,从而提高时间推理性能。我们在 established 的 MUSIC-AVQA 和 MUSIC-AVQA v2 基准上进行评估,其中模型实现了最先进的性能。代码和模型检查点将公开释放。

关键词

引用

@article{arxiv.2511.23304,
  title  = {Multi-Modal Scene Graph with Kolmogorov-Arnold Experts for Audio-Visual Question Answering},
  author = {Zijian Fu and Changsheng Lv and Mengshi Qi and Huadong Ma},
  journal= {arXiv preprint arXiv:2511.23304},
  year   = {2025}
}