中文

通过合成数据增强学习寻找缺失视频帧:通用框架及在利用RGB相机生成热图像中的应用

计算机视觉与模式识别 2024-03-04 v1 人工智能 机器学习

摘要

智能车辆中的高级驾驶辅助系统(ADAS)依赖于车内对驾驶员准确感知,通常结合多种传感模态。然而,这些模态以不同的速率运行,给实时、全面的驾驶员状态监测带来了挑战。本文解决了由于传感器帧率不匹配导致的数据缺失问题,引入了一种生成模型方法来创建合成但逼真的热图像。我们提出使用条件生成对抗网络(cGANs),特别比较了pix2pix和CycleGAN架构。实验结果表明,pix2pix优于CycleGAN,并且利用多视角输入样式(尤其是堆叠视图)提高了热图像生成的准确性。此外,该研究评估了模型在不同受试者上的泛化能力,揭示了个性化训练对于最佳性能的重要性。这些发现表明生成模型在解决缺失帧问题方面的潜力,推动了智能车辆驾驶员状态监测的发展,并强调了在模型泛化和定制方面持续研究的必要性。

关键词

引用

@article{arxiv.2403.00196,
  title  = {Learning to Find Missing Video Frames with Synthetic Data Augmentation: A General Framework and Application in Generating Thermal Images Using RGB Cameras},
  author = {Mathias Viborg Andersen and Ross Greer and Andreas Møgelmose and Mohan Trivedi},
  journal= {arXiv preprint arXiv:2403.00196},
  year   = {2024}
}