听觉信息视频显著性检测综述:视听一致性感知是关键!
计算机视觉与模式识别
2022-06-28 v1 机器学习
声音
音频与语音处理
摘要
视频显著性检测(VSD)旨在快速定位给定视频片段中最具吸引力的物体/事物/模式。现有 VSD 相关工作主要依赖视觉系统,较少关注音频方面,而实际上我们的听觉系统正是视觉系统最重要的互补部分。此外,视听显著性检测(AVSD)作为模仿人类感知机制最具代表性的研究课题之一,目前尚处起步阶段,且现有综述论文均未触及该方向,尤其是从显著性检测视角。因此,本文的最终目标是提供一份广泛综述,以弥合视听融合与显著性检测之间的鸿沟。作为本综述的另一亮点,我们深入剖析了直接决定 AVSD 深度模型性能的关键因素,并指出视听一致度(AVC)——一个长期被忽视的问题,在执行显著性检测时能直接影响利用音频裨益其视觉对应部分的有效性。此外,为使 AVC 问题对未来研究者更具实用与价值,我们为几乎所有现有公开 AVSD 数据集配备了额外的逐帧 AVC 标签。基于这些升级数据集,我们开展了大量定量评估以佐证 AVC 在 AVSD 任务中重要性的主张。总之,我们的思路与新数据集共同构成一个便捷平台,提供基础与指南,均极有潜力推动未来工作进一步提升最先进(SOTA)性能。
引用
@article{arxiv.2206.13390,
title = {A Comprehensive Survey on Video Saliency Detection with Auditory Information: the Audio-visual Consistency Perceptual is the Key!},
author = {Chenglizhao Chen and Mengke Song and Wenfeng Song and Li Guo and Muwei Jian},
journal= {arXiv preprint arXiv:2206.13390},
year = {2022}
}