中文

基于多模态查询定位视频中的事件

计算机视觉与模式识别 2024-11-22 v3 人工智能

摘要

基于语义查询定位视频中的事件是视频理解中的关键任务,随着以用户为导向的应用(如视频搜索)的日益重要。然而,当前研究主要依赖自然语言查询(NLQs),忽视了利用集成图像的多模态查询(MQs)以更灵活地表示语义查询的潜力——尤其是在用文字难以表达非语言或不熟悉概念时。为填补这一差距,我们引入了 ICQ,这是一个为定位以 MQs 为基础的视频事件而设计的新基准测试,以及一个名为 ICQ-Highlight 的评估数据集。为 accommodate 和评估 existing video localization models for this new task,我们提出了 3 种多模态查询适应方法和一种 novel 伪-MQs 代理微调策略。ICQ 在多样化应用领域中系统性地对 12 个 state-of-the-art 主干模型进行基准测试,从 specialized video localization models 到 Video LLMs。我们的实验表明,MQs 在实际应用中具有巨大的潜力。我们相信,这一基准测试是推动 MQs 在视频事件定位方面发展的第一步。

关键词

引用

@article{arxiv.2406.10079,
  title  = {Localizing Events in Videos with Multimodal Queries},
  author = {Gengyuan Zhang and Mang Ling Ada Fok and Jialu Ma and Yan Xia and Daniel Cremers and Philip Torr and Volker Tresp and Jindong Gu},
  journal= {arXiv preprint arXiv:2406.10079},
  year   = {2024}
}

备注

20 pages (including references and appendix); for the project homepage, see https://icq-benchmark.github.io/