中文

满载技能的工具包:具有多样任务视角的自我中心视频理解

计算机视觉与模式识别 2024-03-06 v1 机器学习

摘要

人类对视频流的理解自然是广泛的:在瞬间,我们能够理解正在发生的事情、物体的相关性和关系,并预测不久的将来会发生什么,这一切同时发生。我们认为,为了有效地将这种整体感知转移到智能机器上,学习关联概念和抽象来自不同任务的知识,以便在学习新技能时协同利用它们,起着重要作用。为了实现这一目标,我们寻求一种统一的视频理解方法,该方法结合了对人类动作的共享时间建模且开销最小,以支持多个下游任务并在学习新技能时实现协作。随后,我们提出了 EgoPack,这是一种创建可跨下游任务携带的任务视角集合的解决方案,可用作额外洞察的潜在来源,就像机器人可以随身携带并在需要时使用的技能工具包。我们在四个 Ego4D 基准测试上展示了我们方法的有效性和效率,优于当前的最先进(state-of-the-art)方法。

关键词

引用

@article{arxiv.2403.03037,
  title  = {A Backpack Full of Skills: Egocentric Video Understanding with Diverse Task Perspectives},
  author = {Simone Alberto Peirone and Francesca Pistilli and Antonio Alliegro and Giuseppe Averta},
  journal= {arXiv preprint arXiv:2403.03037},
  year   = {2024}
}

备注

Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition 2024. Project webpage at https://sapeirone.github.io/EgoPack