InstaIndoor与多模态深度学习用于室内场景识别
计算机视觉与模式识别
2021-12-24 v1
摘要
室内场景识别是一个不断发展的领域,在行为理解、机器人定位和老年人监测等方面具有巨大潜力。在本研究中,我们从一个新颖的角度处理场景识别任务,使用多模态学习以及从社交媒体收集的视频数据。社交媒体视频的可获取性与多样性可为现代场景识别技术与应用提供真实数据。我们提出了一种基于转写语音至文本与视觉特征融合的模型,用于在一个名为InstaIndoor的社交媒体室内场景视频新数据集上进行分类。我们的模型达到了高达70%的准确率和0.7的F1分数。此外,我们通过在YouTube-8M室内场景子集上的基准测试也凸显了方法的潜力,其达到了74%的准确率和0.74的F1分数。我们希望本工作的贡献能为室内场景识别这一挑战性领域的全新研究铺平道路。
引用
@article{arxiv.2112.12409,
title = {InstaIndoor and Multi-modal Deep Learning for Indoor Scene Recognition},
author = {Andreea Glavan and Estefania Talavera},
journal= {arXiv preprint arXiv:2112.12409},
year = {2021}
}