中文

利用视觉-语言模型减轻体力活动研究中的标注负担

计算机视觉与模式识别 2025-05-07 v1

摘要

引言:在自由生活环境中采集的可穿戴设备数据,若标注有与健康研究兼容的体力活动行为,对于验证现有基于可穿戴设备的测量方法和开发新型机器学习方法都至关重要。获取这些标签的一种常见方法,依赖于对参与者全天佩戴的相机所拍摄的图像序列进行费力的人工标注。方法:我们比较了三种视觉语言模型和两种判别模型在两项自由生活验证研究中的表现,这两项研究分别有161名和111名参与者,数据分别采集于英国牛津郡和中国四川,使用Autographer(OMG Life,已停产)可穿戴相机。结果:我们发现,在牛津郡研究中,对于未见过的参与者,表现最佳的开源视觉语言模型(VLM)和微调后的判别模型(DM)在从单张图像预测久坐行为时取得了相当的性能;F1分数中位数:VLM = 0.89 (0.84, 0.92),DM = 0.91 (0.86, 0.95)。在轻度体力活动(VLM = 0.60 (0.56, 0.67),DM = 0.70 (0.63, 0.79))和中高强度体力活动(VLM = 0.66 (0.53, 0.85);DM = 0.72 (0.58, 0.84))上,性能有所下降。当应用于外部的四川研究时,所有强度类别的性能均下降,VLM的Cohen's kappa系数中位数从0.54 (0.49, 0.64)降至0.26 (0.15, 0.37),DM的从0.67 (0.60, 0.74)降至0.19 (0.10, 0.30)。结论:免费可用的计算机视觉模型有助于在相似人群中,从可穿戴相机图像中标注久坐行为(通常是日常生活中最普遍的活动),从而减轻标注负担。

关键词

引用

@article{arxiv.2505.03374,
  title  = {Reducing Annotation Burden in Physical Activity Research Using Vision-Language Models},
  author = {Abram Schonfeldt and Benjamin Maylor and Xiaofang Chen and Ronald Clark and Aiden Doherty},
  journal= {arXiv preprint arXiv:2505.03374},
  year   = {2025}
}