中文

超越视野的分割:处理视听语义分割中的部分缺失模态

计算机视觉与模式识别 2024-09-06 v3 声音 音频与语音处理

摘要

增强现实(AR)设备作为新兴的 prominent 移动交互平台,在用户安全方面面临挑战,特别是对于迎面驶来的车辆。尽管一些解决方案利用车载摄像头阵列,但这些摄像头通常具有有限的视场角,且仅具备前方或向下视角。针对这一问题,我们提出了一项新的视野外语义分割任务以及 Segment Beyond View (SBV),一种新颖的视听语义分割方法。SBV 使用师生蒸馏模型(Omni2Ego),利用听觉信息来补充缺失视野外信息的视觉模态。该模型由利用全景信息的视觉教师、具有 8 通道音频的听觉教师以及一个视听学生模型组成;学生模型以有限视场角的视图和双耳音频作为输入,并为视野外的物体生成语义分割。SBV 在对比评估中优于现有模型,并在不同的视场角范围及单耳音频设置下表现出一致的性能。

关键词

引用

@article{arxiv.2312.08673,
  title  = {Segment Beyond View: Handling Partially Missing Modality for Audio-Visual Semantic Segmentation},
  author = {Renjie Wu and Hu Wang and Feras Dayoub and Hsiang-Ting Chen},
  journal= {arXiv preprint arXiv:2312.08673},
  year   = {2024}
}

备注

AAAI-24 (Fixed some erros)