中文

E^2VTS:面向无人机的能效视频文本 spotting

计算机视觉与模式识别 2022-06-07 v1

摘要

基于无人机(UAV)的视频文本 spotting 已广泛用于民用和军事领域。无人机有限的电池容量促使我们开发一种能效的视频文本 spotting 方案。本文中,我们首先重访RCNN的裁剪与缩放(crop & resize)训练策略,并通过经验发现其在无人机捕获的真实世界视频文本数据集上优于对齐RoI采样。为降低能耗,我们进一步提出了一种多阶段图像处理器,该处理器考虑了视频的冗余性、连续性和混合退化。最后,模型在部署到树莓派(Raspberry Pi)前进行了剪枝和量化。我们提出的能效视频文本 spotting 方案称为E^2VTS,通过实现能效与性能间有竞争力的权衡超越了所有先前方法。我们的所有代码和预训练模型可在 https://github.com/wuzhenyusjtu/LPCVC20-VideoTextSpotting 获取。

关键词

引用

@article{arxiv.2206.02281,
  title  = {E^2VTS: Energy-Efficient Video Text Spotting from Unmanned Aerial Vehicles},
  author = {Zhenyu Hu and Zhenyu Wu and Pengcheng Pi and Yunhe Xue and Jiayi Shen and Jianchao Tan and Xiangru Lian and Zhangyang Wang and Ji Liu},
  journal= {arXiv preprint arXiv:2206.02281},
  year   = {2022}
}