从未经筛选视频中多任务学习物体状态变化
计算机视觉与模式识别
2022-11-28 v1
摘要
我们旨在通过观测人在长时段未经筛选的网络视频中与物体交互,来学习在时间上定位物体状态变化及相应的状态改变动作。我们提出了三项主要贡献。首先,我们探索了替代性的多任务网络架构,并确定了能高效联合学习多种物体状态与动作(如倒水与倒咖啡)的模型。其次,我们设计了一种多任务自监督学习流程,其利用了物体与状态改变动作之间的不同类型约束,从而仅从带噪的视频级监督端到端训练用于视频中物体状态与动作时间定位的模型。第三,我们在包含数万条长(未)筛选网络视频的大规模 ChangeIt 与 COIN 数据集上报告了结果,这些视频刻画了钻孔、打发奶油或折纸飞机等多种交互。我们展示了我们的多任务模型相较先前单任务方法取得了 40% 的相对提升,并显著优于针对该问题的基于图像与基于视频的零样本模型。我们还在 EPIC-KITCHENS 与 Ego4D 数据集的长时段自我中心视频上以零样本设定测试了我们的方法,展示了所学模型的鲁棒性。
引用
@article{arxiv.2211.13500,
title = {Multi-Task Learning of Object State Changes from Uncurated Videos},
author = {Tomáš Souček and Jean-Baptiste Alayrac and Antoine Miech and Ivan Laptev and Josef Sivic},
journal= {arXiv preprint arXiv:2211.13500},
year = {2022}
}