中文

面向人类动作识别的视觉模型进阶:探索视觉语言 CLIP 模型在域独立任务中的泛化能力

计算机视觉与模式识别 2025-08-01 v2 机器学习

摘要

人类动作识别在医疗和医学领域发挥着关键作用,支持患者行为监测、跌倒检测、手术机器人监督和程序技能评估等应用。虽然传统模型如CNN和RNN已取得中等成功,但常常难以在多样化且复杂的动作之间实现泛化。近期发展的视觉语言模型,特别是基于Transformer的CLIP模型,为从视频数据中实现动作识别的泛化能力提供了前景的可能性。在本工作中,我们在UCF-101数据集上评估了CLIP,并系统地分析了其在三种遮蔽策略下的性能:(1)基于百分比和形状的10%、30%和50%黑色遮蔽;(2)特征特定遮蔽以抑制产生偏置的元素;(3)仅保留类别特定区域的隔离遮蔽。我们的结果揭示了CLIP在关键视觉线索被遮蔽时表现出不一致的行为和频繁误分类。为克服这些限制,我们提出了纳入类别特定噪声的方法,通过自定义损失函数学习该噪声,以强化对类别定义特征的注意力。该增强措施提高了分类准确率和模型置信度,同时减少了偏置。我们对在临床领域应用此类模型的挑战进行了讨论,并概述了未来工作的方向,以提高其在域独立医疗保健场景中的泛化能力。

关键词

引用

@article{arxiv.2507.18675,
  title  = {Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks},
  author = {Utkarsh Shandilya and Marsha Mariya Kappan and Sanyam Jain and Vijeta Sharma},
  journal= {arXiv preprint arXiv:2507.18675},
  year   = {2025}
}