DAVE:用于动态显著性预测的深度音视觉嵌入
计算机视觉与模式识别
2020-01-09 v2
摘要
本文研究音视觉深度显著性预测。它引入了一种概念上简单而有效的用于动态显著性预测的深度音视觉嵌入,称为“DAVE”,同时我们致力于构建一个名为“AVE”的音视觉眼动追踪语料库。尽管在感知过程中听觉与视觉线索之间存在强关系以引导注视,视频显著性模型仅考虑视觉线索而忽视了动态场景中无处不在的听觉信息。在此,我们借助深度神经网络研究听觉线索与视觉线索结合在预测显著性图方面的适用性。为此,所提模型被有意设计为简单。在同一由编码器-解码器组成的架构上开发了两种基线模型。编码器将输入投影到特征空间,随后解码器推断显著性。我们对不同模态及多模型动态显著性预测的各个方面进行了广泛分析。我们的结果表明:(1) 音频是显著性预测的强贡献线索,(2) 显著的可视声源是我们音视觉模型优越性的自然原因,(3) 即便没有更复杂的显著性解码器,输入空间更丰富的特征表示也能带来更强大的预测,(4) 音视觉模型在 53.54% 的帧上优于最佳视觉模型(我们的基线)的预测。我们的努力表明,音频是提升动态视频显著性预测并帮助模型接近人类表现的重要线索。代码见 https://github.com/hrtavakoli/DAVE
引用
@article{arxiv.1905.10693,
title = {DAVE: A Deep Audio-Visual Embedding for Dynamic Saliency Prediction},
author = {Hamed R. Tavakoli and Ali Borji and Esa Rahtu and Juho Kannala},
journal= {arXiv preprint arXiv:1905.10693},
year = {2020}
}