NAVERO:解锁视频语言组合性的细粒度语义
计算机视觉与模式识别
2024-08-20 v1
摘要
我们研究了视频语言(VidL)模型理解对象、属性、动作及其关系的组合能力。由于视频中组合关系随时间迅速变化,组合理解在视频数据上尤其具有挑战性。我们首先构建了一个名为 AARO 的基准测试,用于评估关于空间概念上动作组合理解的能力。该基准通过为给定视频生成不正确的动作描述的负面文本来构建,模型应将正面文本与其对应的视频配对。此外,我们提出了一种名为 NAVERO 的训练方法,该方法利用由负面文本增强的视频文本数据来增强组合理解。我们还开发了一个用于从生成的负面文本中获益的负面增强视觉语言匹配损失。我们将 NAVERO 与其他最新方法进行比较,评估其组合理解能力以及视频文本检索性能。NAVERO 在视频语言和图像语言组合理解方面均显著优于其他方法,同时在传统文本视频检索任务上保持强大的性能。
引用
@article{arxiv.2408.09511,
title = {NAVERO: Unlocking Fine-Grained Semantics for Video-Language Compositionality},
author = {Chaofan Tao and Gukyeong Kwon and Varad Gunjal and Hao Yang and Zhaowei Cai and Yonatan Dukler and Ashwin Swaminathan and R. Manmatha and Colin Jon Taylor and Stefano Soatto},
journal= {arXiv preprint arXiv:2408.09511},
year = {2024}
}