多视角视觉语言模型与屏幕时间跟踪器用于儿童屏幕时间识别
计算机视觉与模式识别
2025-05-12 v3 人工智能
摘要
准确监测儿童的屏幕暴露对于研究与屏幕使用相关的现象(如儿童肥胖、体力活动和社交互动)至关重要。大多数现有研究依赖自我报告或来自笨重可穿戴传感器的手动测量,因而在捕获定量屏幕暴露数据方面效率和准确性不足。本文开发了一种新型传感器信息框架,利用来自可穿戴传感器的自我中心图像,称为屏幕时间跟踪器(STT),并结合视觉语言模型(VLM)。具体而言,我们设计了一种多视角VLM,该模型从自我中心图像序列的多个视角中动态解释屏幕暴露。我们使用儿童自由活动数据集验证了该方法,显著优于现有方法中的纯视觉语言模型和目标检测模型。结果支持了这一监测方法的前景,可优化儿童自然环境中屏幕暴露的行为研究。
引用
@article{arxiv.2410.01966,
title = {Enhancing Screen Time Identification in Children with a Multi-View Vision Language Model and Screen Time Tracker},
author = {Xinlong Hou and Sen Shen and Xueshen Li and Xinran Gao and Ziyi Huang and Steven J. Holiday and Matthew R. Cribbet and Susan W. White and Edward Sazonov and Yu Gan},
journal= {arXiv preprint arXiv:2410.01966},
year = {2025}
}
备注
Prepare for submission