通过应用于 YouTube 字幕的 NLP 自动生成基于视频的人体姿态分析标注数据
计算机视觉与模式识别
2023-05-03 v2 机器学习
图像与视频处理
摘要
随着计算机视觉与机器学习(ML)的最新进展,基于视频的居家锻炼评估系统已成为当前研究的热点。然而,性能严重依赖于可用训练数据的数量。由于针对锻炼的标注数据集十分稀少,我们提出一种利用线上丰富健身视频的方法。具体而言,我们借助视频通常不仅展示锻炼动作、还提供语言作为额外信息来源的优势。以俯卧撑为例,我们展示通过对字幕数据使用自然语言处理(NLP)进行分析,可以创建一个包含姿态分析相关信息的标注数据集(无关、相关正确、相关错误)。特别地,我们展示无关片段()与相关片段()在关节可见性数值上存在显著差异。对聚类中心的检查也显示出不同类别具有不同姿态。
引用
@article{arxiv.2304.14489,
title = {Automatic Generation of Labeled Data for Video-Based Human Pose Analysis via NLP applied to YouTube Subtitles},
author = {Sebastian Dill and Susi Zhihan and Maurice Rohr and Maziar Sharbafi and Christoph Hoog Antink},
journal= {arXiv preprint arXiv:2304.14489},
year = {2023}
}
备注
4 pages, 5 figures