深入探讨视频文本模型的运动表示
计算机视觉与模式识别
2024-06-10 v1
摘要
视频比图像更具信息性,因为它们捕捉了场景的动态过程。通过表示视频中的运动,我们可以捕捉动态活动。在本工作中,我们引入了 GPT-4 生成的运动描述,捕捉活动中细粒度的运动描述,并应用于三个动作数据集。我们评估了几个视频文本模型在检索运动描述任务上的表现,发现它们在两个动作数据集上远远落后于人类专家水平,这引发了视频文本模型是否理解视频中运动的疑问。为此,我们引入了一种利用运动描述来提高视频文本模型运动理解的方法。该方法在两个动作数据集上针对运动描述检索任务证明有效。结果引起对现有数据集中是否包含涉及细粒度运动信息的高质量标题这一问题的关注,并展示了所提出管道在视频文本检索中理解细粒度运动方面的有效性。
引用
@article{arxiv.2406.05075,
title = {Diving Deep into the Motion Representation of Video-Text Models},
author = {Chinmaya Devaraj and Cornelia Fermuller and Yiannis Aloimonos},
journal= {arXiv preprint arXiv:2406.05075},
year = {2024}
}
备注
ACL Findings , 2024