探索对比语言-图像预训练在人体姿态分类中的应用:徒手瑜伽姿态分析中的启示
计算机视觉与模式识别
2025-11-25 v1 人工智能
摘要
准确的图像和视频中的人体姿态分类对于自动化应用至关重要,包括工作安全、物理康复、体育训练或日常生活中的辅助。近期,诸如对比语言-图像预训练(CLIP)等多模态学习方法在联合理解图像和文本方面取得了显著进展。本研究旨在评估CLIP在人体姿态分类中的效果,聚焦其在瑜伽中的应用。尽管零样本方法最初存在局限,但对15,301张图片(真实与合成)进行迁移学习,包含82个类别,结果显示出有前景的效果。文章描述了完整的微调程序,包括图像描述语法选择、模型和超参数调整。经微调的CLIP模型在3826张图片上测试,准确率超过85%,显著超过同一数据集上以往工作的约6%的SOTA;其训练时间是基于YOLOv8模型微调所需时间的3.5倍。对于更具应用导向的场景,采用包含1301和401训练图片的六个姿态的较小数据集,微调模型分别达到98.8%和99.1%的准确率。此外,我们的实验表明,即使仅使用每个姿态约20张图片的训练数据,也可在六类数据集中获得约90%的准确率。这一研究表明,这种多模态技术可以有效应用于瑜伽姿态分类,可能用于一般人体姿态分类。此外,CLIP推理时间(约7毫秒)支持该模型能够集成到自动化系统中,用于姿态评估,例如开发用于绩效评估的实时个人瑜伽助手。
引用
@article{arxiv.2501.07221,
title = {Exploring the Use of Contrastive Language-Image Pre-Training for Human Posture Classification: Insights from Yoga Pose Analysis},
author = {Andrzej D. Dobrzycki and Ana M. Bernardos and Luca Bergesio and Andrzej Pomirski and Daniel Sáez-Trigueros},
journal= {arXiv preprint arXiv:2501.07221},
year = {2025}
}