中文

视频退化对机器学习赋能的行人检测器性能影响的结构化分析

计算机视觉与模式识别 2021-07-01 v1

摘要

机器学习(ML)赋能的软件系统已融入许多自动驾驶(AD)系统的公开演示中。此类方案也被视为实现SAE 5级系统的关键途径,其中此类车辆的乘客不再需要与系统交互。早在2016年,Nvidia便展示了一种端到端的完整方法,用于训练涵盖感知、规划与决策以及实际车辆控制的完整软件栈。尽管此类方法展示了ML赋能系统的巨大潜力,但也有演示表明,视频帧中单个像素的改变就可能潜在导致完全不同的危险后果决策。本文进行了结构化分析,以探究视频退化对ML赋能行人检测器性能的影响。首先,建立了将YOLO应用于KITTI Vision Benchmark Suite中带行人标注的1,026帧的基线。接着,使用主流视频编解码器libx264、libx265、Nvidia HEVC和AV1为每帧生成视频退化候选:彩色与灰度帧的各种压缩预设共52帧,即每原始KITTI帧104个退化候选,总计426,816张图像。对每张图像应用YOLO计算交并比(IoU)度量以与原始基线比较性能。虽然如预期那样激进的有损压缩设置导致显著性能下降,但也观察到某些配置实际产生略优于基线的IoU结果。研究结果表明,精心选择的有损视频配置在存储或传输数据时允许大幅节省的同时,保持了特定ML赋能系统的良好性能。

关键词

引用

@article{arxiv.2106.15889,
  title  = {A Structured Analysis of the Video Degradation Effects on the Performance of a Machine Learning-enabled Pedestrian Detector},
  author = {Christian Berger},
  journal= {arXiv preprint arXiv:2106.15889},
  year   = {2021}
}