使用 VAE 实现用于自动驾驶的快速高效场景分类
计算机视觉与模式识别
2022-10-28 v1 机器学习
摘要
场景分类是一项有用的前置任务,为许多高级计算机视觉任务提供先验知识,在基于内容的图像索引与检索系统中具有广泛的应用。尽管数据驱动方法在计算机视觉领域(如目标检测、语义分割等)取得了成功,但它们在学习用于场景识别的高级特征方面尚未达到同等的成功水平。我们提出生成一种快速高效的中间可解释广义全局描述符,从图像中捕获粗略特征,并使用分类头将这些描述符映射到 3 个场景类别:乡村、城市和郊区。我们以无监督方式训练变分自编码器(VAE),将图像映射到受约束的多维潜在空间,并使用潜在向量作为紧凑嵌入,作为图像的全局描述符。实验结果表明,VAE 潜在向量从图像中捕获了粗略信息,支持其作为全局描述符的用途。所提出的全局描述符非常紧凑,嵌入长度为 128,计算速度显著更快,并且对季节和光照变化具有鲁棒性,同时捕获了场景分类所需的充足场景信息。
引用
@article{arxiv.2210.14981,
title = {Fast and Efficient Scene Categorization for Autonomous Driving using VAEs},
author = {Saravanabalagi Ramachandran and Jonathan Horgan and Ganesh Sistu and John McDonald},
journal= {arXiv preprint arXiv:2210.14981},
year = {2022}
}
备注
Published in the 24th Irish Machine Vision and Image Processing Conference (IMVIP 2022)