中文

利用多模态链式思考推理实现可解释动作形式评估

计算机视觉与模式识别 2025-12-18 v1

摘要

在现实场景中,评估人类动作是否符合标准并提供合理反馈以改进动作标准化是非常关键且具有挑战性的。然而,当前的视频理解方法主要关注动作的"what"和"where",无法满足这一要求。此外,大多数现有数据集缺乏指示动作标准化程度的标签,动作质量评估数据集也缺乏可解释性和详细的反馈。因此,我们定义了新的人类动作形式评估(Human Action Form Assessment, AFA)任务,引入了新的多样化数据集 CoT-AFA,其中包含大量健身和武术视频的多层级标注,以进行全面视频分析。我们以一种新的链式思考解释范式丰富了 CoT-AFA 数据集。与提供孤立反馈不同,我们的解释提供了完整的推理过程——从识别动作步骤到分析其结果并提出具体解决方案。此外,我们提出了一个名为可解释健身评估器(Explainable Fitness Assessor)的框架,它不仅能判断动作,还能解释原因并提供解决方案。该框架采用两种平行处理流和动态门控机制来融合视觉和语义信息,从而提升其分析能力。实验结果表明,我们的方法在解释生成(例如 CIDEr 提升 16.0%)、动作分类(准确率提升 2.7%)和质量评估(准确率提升 2.1%)方面均取得了改进,显示出 CoT-AFA 对未来研究具有巨大的潜力。我们的数据集和源代码已在 https://github.com/MICLAB-BUPT/EFA 提供。

关键词

引用

@article{arxiv.2512.15153,
  title  = {Explainable Action Form Assessment by Exploiting Multimodal Chain-of-Thoughts Reasoning},
  author = {Mengshi Qi and Yeteng Wu and Xianlin Zhang and Huadong Ma},
  journal= {arXiv preprint arXiv:2512.15153},
  year   = {2025}
}