打破鸡蛋才能做鸡蛋卷:基于大视频语言模型的可信动作预测
计算机视觉与模式识别
2024-05-31 v1
摘要
我们提出 PlausiVL,一个大型视频语言模型,用于预测在现实世界中可信的动作序列。尽管已有大量工作致力于预测未来动作,但先前方法未考虑动作序列的可信度问题。为此,我们探索了大型视频语言模型的生成能力,提出两种目标函数:一种是基于反事实的可信动作序列学习损失,另一种是长时程动作重复损失。我们利用时序逻辑约束和动作名词搭配逻辑约束生成 implausible/反事实动作序列,通过可信动作序列学习损失训练模型。该损失帮助模型区分可信与不可信的动作序列,学习动作预测中至关重要的隐式时序线索。长时程动作重复损失对在更长时程窗口内更易重复的动作施加更大惩罚,从而使模型能够生成多样且可信的动作序列。我们在两个大规模数据集 Ego4D 和 EPIC-Kitchens-100 上进行评估,取得了动作预测任务的提升。
引用
@article{arxiv.2405.20305,
title = {Can't make an Omelette without Breaking some Eggs: Plausible Action Anticipation using Large Video-Language Models},
author = {Himangi Mittal and Nakul Agarwal and Shao-Yuan Lo and Kwonjoon Lee},
journal= {arXiv preprint arXiv:2405.20305},
year = {2024}
}
备注
CVPR 2024