中文

利用视频字幕生成促进体力活动

计算机视觉与模式识别 2021-04-08 v1 人工智能 机器学习

摘要

视频字幕生成被视为计算机视觉领域最具挑战性的问题之一。视频字幕生成涉及组合不同深度学习模型,通过处理图像帧序列来实现目标检测、动作检测与定位。为生成对整体动作事件有意义的描述,考虑视频中动作序列至关重要。可靠、准确且实时的视频字幕生成方法可用于许多应用。但本文聚焦一项应用:用于促进和便利体力活动的视频字幕生成。广义上,该工作可视为辅助技术。由于缺乏体力活动在许多国家似乎日益普遍,最重要因素是技术在工作场所提供的便利性。所采用的久坐生活方式正成为重大公共卫生问题。因此,将更多身体活动纳入日常生活十分必要。追踪每日体力活动可提供与后续日期活动比较的基础。鉴于此,本文提出一个视频字幕生成框架,旨在描述视频中活动并估计个人每日体力活动水平。该框架有潜力帮助人们追踪日常活动以降低久坐生活方式的健康风险。本文工作尚处初期,文中概述了应用的初始步骤。基于初步研究,该项目具有重大价值。

关键词

引用

@article{arxiv.2104.03207,
  title  = {The Use of Video Captioning for Fostering Physical Activity},
  author = {Soheyla Amirian and Abolfazl Farahani and Hamid R. Arabnia and Khaled Rasheed and Thiab R. Taha},
  journal= {arXiv preprint arXiv:2104.03207},
  year   = {2021}
}