姿态至关重要:评估视觉Transformer与卷积神经网络在小规模COCO子集上的人体动作识别
计算机视觉与模式识别
2025-06-16 v1 人工智能
摘要
本研究利用COCO图像语料库的三类子集探索人体动作识别,对从简单全连接网络到Transformer架构的模型进行基准测试。二值视觉Transformer(ViT)实现了90%的平均测试准确率,显著超过多类分类器如卷积网络(约35%)和基于CLIP的模型(约62-64%)。单因素方差分析(F = 61.37, p < 0.001)确认这些差异具有统计学显著性。利用SHAP解释器和LeGrad热力图的定性分析表明,ViT能够定位姿态特定区域(如行走或跑步时的下肢),而更简单的前馈模型通常关注背景纹理,从而解释了其错误。这些发现强调了Transformer表示的数据效率以及可解释性技术在诊断类别特定失败中的重要性。
引用
@article{arxiv.2506.11678,
title = {Pose Matters: Evaluating Vision Transformers and CNNs for Human Action Recognition on Small COCO Subsets},
author = {MingZe Tang and Madiha Kazi},
journal= {arXiv preprint arXiv:2506.11678},
year = {2025}
}
备注
7 pages, 9 figures