中文

利用视觉-语言预训练进行静态图像中的人类活动识别

计算机视觉与模式识别 2025-06-17 v1 计算与语言

摘要

识别单张照片中的人类活动可用于索引、安全和辅助应用,但缺乏运动线索。我们使用 285 张标注为行走、跑步、坐姿和站姿的 MSCOCO 图像,scratch CNN 的准确率为 41%。通过对多模态 CLIP 进行微调,将准确率提高到 76%,这表明对视觉-语言预训练在实际部署中对静态图像动作识别具有决定性的改进作用。

关键词

引用

@article{arxiv.2506.13458,
  title  = {Leveraging Vision-Language Pre-training for Human Activity Recognition in Still Images},
  author = {Cristina Mahanta and Gagan Bhatia},
  journal= {arXiv preprint arXiv:2506.13458},
  year   = {2025}
}