ViNet:推进视觉模态在音视频显著性预测中的极限
计算机视觉与模式识别
2021-08-10 v3
摘要
我们提出用于音视频显著性预测的 ViNet 架构。ViNet 是一种全卷积编码器-解码器架构。编码器使用来自为动作识别训练的网络中的视觉特征,解码器通过三线性插值和 3D 卷积推断显著性图,并结合来自多个层级的特征。ViNet 的整体架构在概念上简洁;它是因果的并以实时(60 fps)运行。ViNet 不将音频作为输入,仍能在九个数据集(三个仅视觉和六个音视频数据集)上优于最先进的音视频显著性预测模型。ViNet 在 AVE 数据集的 CC、SIM 和 AUC 指标上也超越了人类表现,据我们所知,它是首个做到这一点的网络。我们还探索了通过将音频特征增强到解码器中的 ViNet 架构变体。令我们惊讶的是,在充分训练后,该网络对输入音频变得不敏感,无论输入如何都提供相同输出。有趣的是,我们也在先前最先进的音视频显著性预测模型 [tsiami2020stavis] 中观察到类似行为。我们的发现与先前基于深度学习的音视频显著性预测工作形成对比,指出了以更有效方式融合音频的未来探索方向。代码与预训练模型可在 https://github.com/samyak0210/ViNet 获取。
引用
@article{arxiv.2012.06170,
title = {ViNet: Pushing the limits of Visual Modality for Audio-Visual Saliency Prediction},
author = {Samyak Jain and Pradeep Yarlagadda and Shreyank Jyoti and Shyamgopal Karthik and Ramanathan Subramanian and Vineet Gandhi},
journal= {arXiv preprint arXiv:2012.06170},
year = {2021}
}
备注
Appearing in the proceedings of the 2021 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2021) (camera-ready version)