自我中心视频任务翻译
计算机视觉与模式识别
2023-04-10 v2
摘要
不同的视频理解任务通常被视为相互孤立,甚至使用不同类型的精选数据(例如,在一个数据集中分类运动,在另一个中跟踪动物)。然而,在可穿戴相机中,人与周围世界互动的沉浸式自我中心视角呈现了一个相互关联的视频理解任务网络——手-物操作、空间中的导航或人人交互——这些任务连续展开,由人的目标驱动。我们认为这需要一种更加统一的方法。我们提出EgoTask Translation(EgoT2),它接收一组在独立任务上优化的模型,并学习翻译它们的输出,以一次性改善其中任意或全部任务的性能。与传统的迁移或多任务学习不同,EgoT2的反转设计包含独立的任务特定主干和一个跨所有任务共享的任务翻译器,其捕获甚至异构任务之间的协同作用并缓解任务竞争。在Ego4D的广泛视频任务上展示我们的模型,我们显示了其相对于现有迁移范式的优势,并在Ego4D 2022基准挑战中的四项上取得了排名靠前的成果。
引用
@article{arxiv.2212.06301,
title = {Egocentric Video Task Translation},
author = {Zihui Xue and Yale Song and Kristen Grauman and Lorenzo Torresani},
journal= {arXiv preprint arXiv:2212.06301},
year = {2023}
}
备注
Accepted by CVPR 2023 (Highlight), Project website: https://vision.cs.utexas.edu/projects/egot2/