面向未见视角的时序动作分割
计算机视觉与模式识别
2025-04-04 v1 人工智能
机器学习
摘要
尽管时序动作分割取得了显著进展,但面向未见视角的泛化挑战仍未被解决。因此,我们定义了一个未见视角动作分割协议,其中用于评估模型的摄像机视角在训练时不可用。这包括从顶部-前瞄视角更改为侧面视角,甚至更具挑战性的从外围视角到内观视角。进一步地,我们提出了一种针对该挑战的方法。我们的做法利用序列和片段水平的共享表示,以减少训练期间视角差异的影响。为此,我们引入序列损失和动作损失,这两者共同促进了不同视角下视频和动作表示的一致性。在Assembly101、IkeaASM和EgoExoLearn数据集上的评估显示,针对未见的外围视角F1@50提升了12.8%,针对未见的内观视角提升了约54%。
引用
@article{arxiv.2504.02512,
title = {Towards Generalizing Temporal Action Segmentation to Unseen Views},
author = {Emad Bahrami and Olga Zatsarynna and Gianpiero Francesca and Juergen Gall},
journal= {arXiv preprint arXiv:2504.02512},
year = {2025}
}