Szloca:面向交互艺术中单摄像头全三维跟踪的框架
计算机视觉与模式识别
2022-06-28 v1 人机交互
多媒体
摘要
大面积内物体与人类存在的实时虚拟数据,对于实现诸多行业中的体验与应用具有关键价值;随着人工智能技术发展的指数级增长,计算机视觉拓展了仅通过视频输入进行跟踪与分类的可能性,这也超越了传统上用于检测人体姿态与位置的最流行和常见硬件设置(如视场角小、跟踪能力有限)的局限。在计算机视觉应用开发中使用计算机视觉益处良多,因其增强了传统输入源(如视频流)并可集成于多种环境与平台。在新媒体交互艺术(基于身体运动并延展至大面积或画廊)的语境下,本研究提出了一种新颖途径及一个框架,用于从单个 RGB 摄像头获取物体/人的数据与虚拟表示——例如三维位置、骨架/姿态与掩码。通过考察近期一些最先进进展并基于计算机视觉领域先前研究,本文还提出了一种从单目图像获取三维位置数据的原创方法;该模型不依赖复杂的计算机视觉系统训练,而是结合已有计算机视觉研究并增添表示 z 深度的能力,即从二维输入源表示三维世界坐标。
引用
@article{arxiv.2206.12958,
title = {Szloca: towards a framework for full 3D tracking through a single camera in context of interactive arts},
author = {Sahaj Garg},
journal= {arXiv preprint arXiv:2206.12958},
year = {2022}
}