视觉语言模型能否判断动作质量?经验评估
计算机视觉与模式识别
2026-04-10 v1 人工智能
计算与语言
摘要
动作质量评估(AQA)在物理治疗、体育教练和竞技评判等领域具有广泛应用前景。尽管视觉语言模型(VLMs)在AQA领域具有巨大的潜力,但其在该领域的实际性能仍基本未被 characterize。我们对最新VLMs进行全面评估,涵盖活动领域(如健身、花式滑冰、跳台跳水)、任务、表示和提示策略。基准结果表明,Gemini 3.1 Pro、Qwen3-VL和InternVL3.5模型仅略高于随机猜测,尽管包括骨架信息、grounding指令、推理结构和情境学习等策略带来了局部性提升,但从未一致有效。对预测分布的分析揭示了两个系统性偏差:一种倾向于无论视觉证据如何,都预测正确执行;另一种对浅层语言框架敏感。将任务重新构建为对比式以缓解这些偏差,仅带来最小改进,表明模型的局限性超出这些偏差,指向对细粒度运动质量评估存在根本性难题。我们的发现为未来的VLM-based AQA研究奠定了严谨的基准,并为在可靠实际部署前需要缓解的失效模式提供了可操作的概述。
引用
@article{arxiv.2604.08294,
title = {Can Vision Language Models Judge Action Quality? An Empirical Evaluation},
author = {Miguel Monte e Freitas and Rui Henriques and Ricardo Rei and Pedro Henrique Martins},
journal= {arXiv preprint arXiv:2604.08294},
year = {2026}
}