中文

面向第一人称视频中程序性活动理解的任务图最大似然估计

计算机视觉与模式识别 2025-02-27 v2

摘要

我们引入了一种基于梯度的方法,用于从程序性活动中学习任务图,改进了手工制作的方法。我们的方法通过最大似然直接优化边权重,使其能够集成到神经架构中。我们在CaptainCook4D、EgoPER和EgoProceL数据集上验证了我们的方法,F1分数分别提升了+14.5%、+10.2%和+13.6%。我们基于特征的方法用于从文本/视频嵌入中预测任务图,展示了新兴的视频理解能力。我们还在Ego-Exo4D的程序理解基准上取得了最佳性能,并显著改进了在线错误检测(在Assembly101-O上提升+19.8%,在EPIC-Tent-O上提升+6.4%)。代码:https://github.com/fpv-iplab/Differentiable-Task-Graph-Learning。

关键词

引用

@article{arxiv.2502.17753,
  title  = {Task Graph Maximum Likelihood Estimation for Procedural Activity Understanding in Egocentric Videos},
  author = {Luigi Seminara and Giovanni Maria Farinella and Antonino Furnari},
  journal= {arXiv preprint arXiv:2502.17753},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2406.01486