LocoMotion: 学习面向运动的视频语言表示
计算机视觉与模式识别
2024-10-24 v2 计算与语言
多媒体
摘要
本文致力于学习面向运动的视频语言表示。现有方法用于学习视频语言表示使用空间聚焦的数据,其中识别对象和场景通常足以区分相关标题。我们相反提出LocoMotion,以学习面向运动聚焦的标题,这些标题描述局部对象运动的运动和时间进程。我们通过向视频添加合成运动并使用这些运动的参数来生成相应的标题来实现这一点。此外,我们提出了动词变体改写以增加标题的多样性并学习原始运动与高层次动词之间的关系。通过此,我们能够学习面向运动的视频语言表示。实验表明我们的方法对各种下游任务有效,特别是在针对细调的情况下数据有限。代码可在https://hazeldoughty.github.io/Papers/LocoMotion/获取。
引用
@article{arxiv.2410.12018,
title = {LocoMotion: Learning Motion-Focused Video-Language Representations},
author = {Hazel Doughty and Fida Mohammad Thoker and Cees G. M. Snoek},
journal= {arXiv preprint arXiv:2410.12018},
year = {2024}
}
备注
ACCV 2024 Oral