中文

重思视频-文本理解:来自反事实增强数据的检索

计算机视觉与模式识别 2024-07-19 v1

摘要

近期的视频-文本基础模型在广泛的下游视频理解任务上表现出强大的性能。这些视频-文本模型是否能真正理解自然视频的内容?标准的视频-文本评估可能具有误导性,因为许多问题仅可从单个帧中的物体和上下文或数据集中固有的偏见中推断。在本文中,我们旨在更好地评估当前视频-文本模型的能力并理解其局限性。我们提出了一种新颖的视频-文本理解评估任务,即来自反事实增强数据的检索(RCAD),并构建了一个新的Feint6K数据集。要成功地完成我们的新评估任务,模型必须从跨帧推理中全面理解视频。分析表明,先前的视频-文本基础模型容易被反事实增强数据所欺骗,远远落后于人类水平。在缩小视频-文本模型与人类在RCAD上表现差距方面,我们识别了当前视频-文本数据上对比学习方法的关键局限性,并引入了LLM-teacher,一种更有效的方法,通过利用来自预训练大语言模型获取的知识来学习动作语义。实验和分析表明,我们的方法成功地学习了更具辨识力的动作嵌入,并在应用于多个视频-文本模型时提高了Feint6K上的结果。我们的Feint6K数据集和项目页面可在https://feint6k.github.io获得。

关键词

引用

@article{arxiv.2407.13094,
  title  = {Rethinking Video-Text Understanding: Retrieval from Counterfactually Augmented Data},
  author = {Wufei Ma and Kai Li and Zhongshi Jiang and Moustafa Meshry and Qihao Liu and Huiyu Wang and Christian Häne and Alan Yuille},
  journal= {arXiv preprint arXiv:2407.13094},
  year   = {2024}
}

备注

ECCV 2024. Project page: https://feint6k.github.io