中文

跨不同自我中心视频理解任务学习可复用概念

计算机视觉与模式识别 2025-06-02 v1

摘要

我们对描绘人类活动的视频流的理解自然是多层面的:在短短片刻间,我们能够掌握正在发生的事情、识别场景中物体的相关性与交互作用,并预测即将发生什么,所有这一切都在瞬间同时完成。为了赋予自主系统这种整体感知能力,学习如何关联概念、跨多样化任务抽象知识,并在学习新技能时利用任务协同性至关重要。在本文中,我们引入了 Hier-EgoPack,这是一个统一的框架,能够创建一系列任务视角集合,这些视角可以迁移到下游任务中,并作为潜在附加见解的来源,就像一个机器人可以随身携带并在需要时使用的技能背包。

关键词

引用

@article{arxiv.2505.24690,
  title  = {Learning reusable concepts across different egocentric video understanding tasks},
  author = {Simone Alberto Peirone and Francesca Pistilli and Antonio Alliegro and Tatiana Tommasi and Giuseppe Averta},
  journal= {arXiv preprint arXiv:2505.24690},
  year   = {2025}
}

备注

Extended abstract derived from arXiv:2502.02487. Presented at the Second Joint Egocentric Vision (EgoVis) Workshop (CVPR 2025)