中文

瞬时相位在基于卷积神经网络的人脸检测中的重要性

计算机视觉与模式识别 2022-08-04 v1 图像与视频处理

摘要

卷积神经网络(CNN)为处理数字图像和视频提供了新颖且准确的方法。然而,训练 CNN 在计算资源方面极为苛刻。此外,对于特定应用,标准地使用迁移学习也往往比实际所需消耗远更多的资源。而且,最终系统往往作为难以解释的黑箱运行。本论文考虑从 AOLME 视频数据集中检测人脸的问题。AOLME 数据集包含大量在无约束课堂环境中记录的群体互动视频集合。对于本论文,从 18 个 24 分钟视频中每分钟提取静态图像帧。然后,每个视频帧被划分为 9x5 个块,每块 50x50 像素。对于 19440 个块中的每一个,人脸像素的百分比被设为真实值。人脸检测随后被定义为确定每个块中人脸像素百分比的回归问题。为测试不同方法,12 个视频用于训练和验证,其余 6 个视频用于测试。本论文考察了使用瞬时相位对 AOLME 基于块的人脸检测应用的影响。为比较,本论文对比了基于瞬时相位的调频(FM)图像的使用、瞬时幅度(AM)的使用以及原始灰度图像。为生成 FM 和 AM 输入,本论文使用主导分量分析,旨在降低训练开销同时保持可解释性。

关键词

引用

@article{arxiv.2208.01638,
  title  = {The Importance of the Instantaneous Phase in Detecting Faces with Convolutional Neural Networks},
  author = {Luis Sanchez Tapia},
  journal= {arXiv preprint arXiv:2208.01638},
  year   = {2022}
}

备注

Master Thesis