基于对齐跨模态蒸馏的声学辅助密集二维与三维室内预测
计算机视觉与模式识别
2023-09-21 v1
摘要
声音可以在日常生活中传达用于空间推理的重要信息。为赋予深度网络此种能力,我们通过跨模态知识蒸馏解决利用声音进行密集室内预测(涵盖二维与三维)的挑战。在本文中,我们提出一种通过匹配实现空间对齐(SAM)的蒸馏框架,在视觉到音频的知识迁移中引出两种模态间的局部对应。SAM 将音频特征与视觉一致的、可学习的空间嵌入相整合,以解决学生模型多层中的不一致性。我们的方法不依赖于特定的输入表示,允许输入形状或维度的灵活性而不造成性能下降。借助新整理的基准 Dense Auditory Prediction of Surroundings(DAPS),我们首次利用音频观测解决全向周围环境的密集二维与三维室内预测。具体而言,对于基于音频的深度估计、语义分割以及具挑战性的三维场景重建,所提出的蒸馏框架在各种指标和骨干架构上一致取得了最先进的性能。
引用
@article{arxiv.2309.11081,
title = {Dense 2D-3D Indoor Prediction with Sound via Aligned Cross-Modal Distillation},
author = {Heeseung Yun and Joonil Na and Gunhee Kim},
journal= {arXiv preprint arXiv:2309.11081},
year = {2023}
}
备注
Published to ICCV2023