中文

ProfVLM:用于多视角专业能力评估的轻量级视频语言模型

计算机视觉与模式识别 2026-04-21 v4 计算与语言

摘要

现有大多数方法将动作质量评估和技能专业能力估计建模为判别式预测任务,通常生成离散标签或评分,而未明确建模评估背后的推理过程。我们将问题重新表述为生成式视觉语言建模,提出 ProfVLM,一种参数高效的视觉语言模型,能够联合预测专业能力水平并生成来自多视角视频的专家式自然语言反馈。ProfVLM 利用条件语言生成提供可操作的见解以及量化评估得分。我们方法的核心是 AttentiveGatedProjector,其动态融合和投影来自冻结 TimeSformer 主干网络的多视角自我中心和外自我中心特征,以针对反馈生成微调的语言模型。基于专家注释训练的 ProfVLM 在使用最少参数的情况下超越了最先进的方法,同时将训练时间缩短了最高可达 60%。通过提供与性能水平一致的自然语言批评,本工作表明生成式视觉语言建模为可解释的动作质量评估提供了一种强大且高效的范式转变。

关键词

引用

@article{arxiv.2509.26278,
  title  = {ProfVLM: A lightweight video-language model for multi-view proficiency estimation},
  author = {Edoardo Bianchi and Jacopo Staiano and Antonio Liotta},
  journal= {arXiv preprint arXiv:2509.26278},
  year   = {2026}
}