中文

听后观察:基于听觉注意力的视频对齐

计算机视觉与模式识别 2024-04-23 v1 计算与语言 机器学习

摘要

视频问答(VQA)是一项具有挑战性的任务,尤其是在处理社交智能问答(SIQA)时更为复杂。SIQA需要理解上下文、进行时间推理以及整合多模态信息,但还需处理细致的人类行为。此外,所涉及的复杂性因主导模式(文本)对其他模式的支配而加剧。因此,需要帮助次要模式与主要模式协同工作。本文引入一种跨模态对齐和后续表示融合方法,实现了在Social IQ 2.0数据集上达到82.06%准确率的SOTA成绩。我们的方法通过将音频模态作为语言模态的桥梁,提高了对视频模态的利用能力。这导致性能提升,减少了当前技术在语言过拟合及随之而来的视频模态旁路问题。我们的代码和模型已公开于https://github.com/sts-vlcc/sts-vlcc。

关键词

引用

@article{arxiv.2404.13530,
  title  = {Listen Then See: Video Alignment with Speaker Attention},
  author = {Aviral Agrawal and Carlos Mateo Samudio Lezcano and Iqui Balam Heredia-Marin and Prabhdeep Singh Sethi},
  journal= {arXiv preprint arXiv:2404.13530},
  year   = {2024}
}