中文

通过关键语义感知线索提升视听问答

计算机视觉与模式识别 2024-07-31 v1 人工智能 多媒体

摘要

视听问答(AVQA)任务旨在回答与视频中各种视觉对象、声音及其交互相关的问题。此类自然多模态视频包含丰富且复杂的动态视听成分,其中只有一部分与给定问题密切相关。因此,有效感知与给定问题相关的视听线索对于正确回答至关重要。在本文中,我们提出了一个时空感知模型(TSPM),旨在赋予模型感知与问题相关的关键视觉和听觉线索的能力。具体来说,考虑到使用视觉-语言预训练模型将非陈述性问题与视觉表示对齐到同一语义空间的挑战,我们构建了从问题模板派生的陈述性句子提示,以辅助时间感知模块更好地识别与问题相关的关键片段。随后,设计了一个空间感知模块来合并来自选定片段的视觉令牌,以突出关键的潜在目标,然后与音频进行跨模态交互,以感知潜在的声音感知区域。最后,整合来自这些模块的重要时空线索来回答问题。在多个AVQA基准上的大量实验表明,我们的框架不仅在理解视听场景方面表现出色,而且在有效回答复杂问题方面也表现优异。代码可在 https://github.com/GeWu-Lab/TSPM 获取。

关键词

引用

@article{arxiv.2407.20693,
  title  = {Boosting Audio Visual Question Answering via Key Semantic-Aware Cues},
  author = {Guangyao Li and Henghui Du and Di Hu},
  journal= {arXiv preprint arXiv:2407.20693},
  year   = {2024}
}

备注

Accepted by ACM MM 2024