Hier-EgoPack:面向多样化任务视角的层次化以自我为中心视频理解
计算机视觉与模式识别
2025-02-05 v1
摘要
我们对描绘人类活动的视频流的理解本质上是多方面的:在短短一瞬间,我们就能同时把握正在发生的事情,识别场景中物体的相关性和交互,并预测即将发生什么。为了赋予自主系统这种整体感知能力,学习如何关联概念、跨多样化任务抽象知识,并在学习新技能时利用任务间的协同作用至关重要。EgoPack 是朝此方向迈出的重要一步,它是一个统一的框架,用于以最小的开销理解跨多样化任务的人类活动。EgoPack 促进下游任务之间的信息共享与协作,这对于高效学习新技能至关重要。在本文中,我们介绍了 Hier-EgoPack,它通过支持跨不同时间粒度的推理来推进 EgoPack,从而将其适用性扩展到更广泛的下游任务。为实现这一目标,我们提出了一种用于时间推理的新型层次化架构,并配备了一个专门设计用于有效应对多粒度推理挑战的 GNN 层。我们在涉及片段级和帧级推理的多个 Ego4d 基准上评估了我们的方法,展示了我们的层次化统一架构如何有效地同时解决这些多样化任务。
引用
@article{arxiv.2502.02487,
title = {Hier-EgoPack: Hierarchical Egocentric Video Understanding with Diverse Task Perspectives},
author = {Simone Alberto Peirone and Francesca Pistilli and Antonio Alliegro and Tatiana Tommasi and Giuseppe Averta},
journal= {arXiv preprint arXiv:2502.02487},
year = {2025}
}
备注
Project webpage at https://sapeirone.github.io/hier-egopack