跨不同自我中心视频理解任务学习可复用概念
计算机视觉与模式识别
2025-06-02 v1
摘要
我们对描绘人类活动的视频流的理解自然是多层面的:在短短片刻间,我们能够掌握正在发生的事情、识别场景中物体的相关性与交互作用,并预测即将发生什么,所有这一切都在瞬间同时完成。为了赋予自主系统这种整体感知能力,学习如何关联概念、跨多样化任务抽象知识,并在学习新技能时利用任务协同性至关重要。在本文中,我们引入了 Hier-EgoPack,这是一个统一的框架,能够创建一系列任务视角集合,这些视角可以迁移到下游任务中,并作为潜在附加见解的来源,就像一个机器人可以随身携带并在需要时使用的技能背包。
引用
@article{arxiv.2505.24690,
title = {Learning reusable concepts across different egocentric video understanding tasks},
author = {Simone Alberto Peirone and Francesca Pistilli and Antonio Alliegro and Tatiana Tommasi and Giuseppe Averta},
journal= {arXiv preprint arXiv:2505.24690},
year = {2025}
}
备注
Extended abstract derived from arXiv:2502.02487. Presented at the Second Joint Egocentric Vision (EgoVis) Workshop (CVPR 2025)