面向第一人称视频中程序性活动理解的任务图最大似然估计
计算机视觉与模式识别
2025-02-27 v2
摘要
我们引入了一种基于梯度的方法,用于从程序性活动中学习任务图,改进了手工制作的方法。我们的方法通过最大似然直接优化边权重,使其能够集成到神经架构中。我们在CaptainCook4D、EgoPER和EgoProceL数据集上验证了我们的方法,F1分数分别提升了+14.5%、+10.2%和+13.6%。我们基于特征的方法用于从文本/视频嵌入中预测任务图,展示了新兴的视频理解能力。我们还在Ego-Exo4D的程序理解基准上取得了最佳性能,并显著改进了在线错误检测(在Assembly101-O上提升+19.8%,在EPIC-Tent-O上提升+6.4%)。代码:https://github.com/fpv-iplab/Differentiable-Task-Graph-Learning。
引用
@article{arxiv.2502.17753,
title = {Task Graph Maximum Likelihood Estimation for Procedural Activity Understanding in Egocentric Videos},
author = {Luigi Seminara and Giovanni Maria Farinella and Antonino Furnari},
journal= {arXiv preprint arXiv:2502.17753},
year = {2025}
}
备注
arXiv admin note: text overlap with arXiv:2406.01486