中文

SkillFormer:用于技能估计的统一多视角视频理解

计算机视觉与模式识别 2025-10-06 v5

摘要

在运动、康复和训练等场景中,评估人类在复杂活动中的技能水平是一个具有挑战性的问题。本文提出 SkillFormer,一个用于从 egocentric 和 exocentric 视频中进行统一多视角技能估计的参数高效架构。基于 TimeSformer 主干网络,SkillFormer 引入 CrossViewFusion 模块,通过多头交叉注意力、可学习门控和自适应自校准融合视角特定特征。我们利用低秩适应技术仅微调少量参数,显著降低了训练成本。事实上,在在 EgoExo4D 数据集上评估时,SkillFormer 在多视角设置下实现了最先进的准确度,同时在计算效率方面表现突出,使用参数数目减少 4.5 倍,训练所需 epoch 数目减少 3.75 倍。它在多个结构化任务中表现出色,确认了多视角集成对于细粒度技能评估的价值。项目页面可在 https://edowhite.github.io/SkillFormer 查看。

关键词

引用

@article{arxiv.2505.08665,
  title  = {SkillFormer: Unified Multi-View Video Understanding for Proficiency Estimation},
  author = {Edoardo Bianchi and Antonio Liotta},
  journal= {arXiv preprint arXiv:2505.08665},
  year   = {2025}
}

备注

Accepted at the 2025 18th International Conference on Machine Vision. Project page at https://edowhite.github.io/SkillFormer