中文

C^3Net:用于高效实时视觉主动相机控制的端到端深度学习

计算机视觉与模式识别 2021-07-29 v1 机器人学

摘要

在智能相机监控、智能环境和无人机等应用中,对自动化实时视觉系统的需求 necessitate 改进视觉主动监控与控制方法。传统上,主动监控任务通过检测、滤波和控制等模块流水线处理。然而,此类方法难以联合优化并在资源受限系统中实时处理时调谐其各种参数。本文提出一种深度卷积相机控制器神经网络,直接从视觉信息到相机运动,为主动视觉问题提供高效解决方案。它经过端到端训练,无需边界框标注,即可从原始像素值控制相机并跟随多个目标。通过仿真框架和真实实验装置的评估表明,所提方案对变化条件具有鲁棒性,并且在监控目标数量与有效监控时间方面均能取得优于传统方法的监控性能。所提方法的优势在于计算需求较低,可在嵌入式智能相机上以超过10 FPS(约4倍加速)运行,为实时主动监控提供实用且经济的解决方案。

关键词

引用

@article{arxiv.2107.13233,
  title  = {C^3Net: End-to-End deep learning for efficient real-time visual active camera control},
  author = {Christos Kyrkou},
  journal= {arXiv preprint arXiv:2107.13233},
  year   = {2021}
}

备注

Journal of Real-Time Image Processing , 2021. Real-time active vision, Smart camera, Deep learning, End-to-end learning https://www.youtube.com/watch?v=UuepDtWUpsg&ab_channel=ChristosKyrkou. arXiv admin note: text overlap with arXiv:2012.06428