中文

RTQ:基于图像-文本模型重新审视视频-语言理解

计算机视觉与模式识别 2023-12-19 v2 计算与语言 多媒体

摘要

视频-语言理解的最新进展建立在图像-文本模型的基础之上,由于图像与视频之间的共享知识而取得了有前景的成果。然而,视频-语言理解因包含高度复杂的语义细节而带来独特挑战,导致信息冗余、时间依赖与场景复杂性。当前技术仅部分解决了这些问题,且我们的定量分析表明其中某些方法具有互补性。有鉴于此,我们提出一种称为 RTQ(Refine、Temporal model、Query)的新框架,可同时应对这些挑战。该方法包括精炼帧内冗余信息、建模帧间时间关系,以及从视频中查询任务特定信息。值得注意的是,即便没有视频-语言预训练,我们的模型仍表现出色,其结果可与最先进预训练方法相媲美甚至更优。代码见 https://github.com/SCZwangxiao/RTQ-MM2023。

关键词

引用

@article{arxiv.2312.00347,
  title  = {RTQ: Rethinking Video-language Understanding Based on Image-text Model},
  author = {Xiao Wang and Yaoyu Li and Tian Gan and Zheng Zhang and Jingjing Lv and Liqiang Nie},
  journal= {arXiv preprint arXiv:2312.00347},
  year   = {2023}
}

备注

Accepted by ACM MM 2023 as Oral representation