中文

面向未见视角的时序动作分割

计算机视觉与模式识别 2025-04-04 v1 人工智能 机器学习

摘要

尽管时序动作分割取得了显著进展,但面向未见视角的泛化挑战仍未被解决。因此,我们定义了一个未见视角动作分割协议,其中用于评估模型的摄像机视角在训练时不可用。这包括从顶部-前瞄视角更改为侧面视角,甚至更具挑战性的从外围视角到内观视角。进一步地,我们提出了一种针对该挑战的方法。我们的做法利用序列和片段水平的共享表示,以减少训练期间视角差异的影响。为此,我们引入序列损失和动作损失,这两者共同促进了不同视角下视频和动作表示的一致性。在Assembly101、IkeaASM和EgoExoLearn数据集上的评估显示,针对未见的外围视角F1@50提升了12.8%,针对未见的内观视角提升了约54%。

关键词

引用

@article{arxiv.2504.02512,
  title  = {Towards Generalizing Temporal Action Segmentation to Unseen Views},
  author = {Emad Bahrami and Olga Zatsarynna and Gianpiero Francesca and Juergen Gall},
  journal= {arXiv preprint arXiv:2504.02512},
  year   = {2025}
}