Exo2EgoDVC:利用网络教学视频进行第一视角程序性活动的密集视频描述
计算机视觉与模式识别
2024-12-10 v4 计算与语言
摘要
我们提出了一种用于密集视频描述跨视角知识迁移的新基准,将具有外部视角(exocentric)的网络教学视频模型适配到第一视角(egocentric)。虽然密集视频描述(预测时间段及其描述)主要基于外部视角视频(如YouCook2)进行研究,但受数据稀缺限制,第一视角视频的基准很少。为克服有限的视频可用性,从丰富的外部视角网络视频迁移知识是一种实用方法。然而,由于其动态的视角变化,学习外部视角与第一视角之间的对应关系十分困难。网络视频包含展示全身或手部区域的镜头,而第一视角则不断移动。这就需要在复杂视角变化下对跨视角迁移进行深入研究。为此,我们首先创建了一个真实场景的第一视角数据集(EgoYC2),其描述遵循YouCook2描述的定义,从而可在获取真值的情况下实现这些数据集间的迁移学习。为弥合视角鸿沟,我们提出一种使用对抗训练的视角不变学习方法,包含预训练和微调两个阶段。我们的实验证实了克服视角变化问题及向第一视角知识迁移的有效性。我们的基准将跨视角迁移的研究推进到密集视频描述这一新任务领域,并展望了用自然语言描述第一视角视频的方法。
引用
@article{arxiv.2311.16444,
title = {Exo2EgoDVC: Dense Video Captioning of Egocentric Procedural Activities Using Web Instructional Videos},
author = {Takehiko Ohkawa and Takuma Yagi and Taichi Nishimura and Ryosuke Furuta and Atsushi Hashimoto and Yoshitaka Ushiku and Yoichi Sato},
journal= {arXiv preprint arXiv:2311.16444},
year = {2024}
}
备注
Accepted to WACV 2025. Project page: https://tkhkaeio.github.io/projects/25-egodvc/