中文

参数高效的多视角熟练度估计:从判别式分类到生成式反馈

计算机视觉与模式识别 2026-05-06 v1

摘要

估计一个人执行动作的好坏程度,而不是执行了哪个动作,是教练指导、康复治疗和人才识别的核心。这项任务具有挑战性,因为熟练度编码于时间、平衡、身体力学和执行中的细微差异中,这些差异通常分布在多个视角和短暂的时序事件中。我们讨论了在 Ego-Exo4D 上进行多视角熟练度估计的三个近期贡献。SkillFormer 引入了一种用于选择性多视角融合的参数高效判别式架构;PATS 通过保留基础动作的局部密集摘录来改进时间采样;ProfVLM 将熟练度估计重新表述为条件语言生成,通过门控跨视角投影器和紧凑的语言主干网络,同时生成熟练度标签和专家风格的反馈。这些方法共同在 Ego-Exo4D 上实现了 SOTA 准确率,其可训练参数比 video-transformer 基线少达 20 倍,训练周期少达 3 倍,同时从闭集分类转向可解释的反馈生成。这些结果突显了向结合选择性融合、熟练度感知采样和可操作生成反馈的高效多视角系统转变的趋势。

关键词

引用

@article{arxiv.2605.03848,
  title  = {Parameter-Efficient Multi-View Proficiency Estimation: From Discriminative Classification to Generative Feedback},
  author = {Edoardo Bianchi and Antonio Liotta},
  journal= {arXiv preprint arXiv:2605.03848},
  year   = {2026}
}