基于组合副词-动作嵌入的视频副词检索
计算机视觉与模式识别
2023-09-27 v1
摘要
检索描述视频中动作的副词是细粒度视频理解的关键一步。我们提出一个视频到副词检索(及反向检索)框架,该框架在联合嵌入空间中将视频嵌入与其匹配的组合副词-动作文本嵌入对齐。组合副词-动作文本嵌入使用残差门控机制学习,并配合由三元组损失与回归目标组成的新训练目标。我们的方法在五个近期的视频副词检索基准上取得了state-of-the-art性能。此外,我们引入了数据集划分,以在MSR-VTT Adverbs和ActivityNet Adverbs数据集子集上基准测试未见副词-动作组合的视频副词检索。我们提出的框架在从视频中检索未见副词-动作组合副词的泛化任务上优于所有先前工作。代码与数据集划分见https://hummelth.github.io/ReGaDa/。
引用
@article{arxiv.2309.15086,
title = {Video-adverb retrieval with compositional adverb-action embeddings},
author = {Thomas Hummel and Otniel-Bogdan Mercea and A. Sophia Koepke and Zeynep Akata},
journal= {arXiv preprint arXiv:2309.15086},
year = {2023}
}
备注
BMVC 2023 (Oral)