运动与上下文感知的视听条件视频预测
计算机视觉与模式识别
2023-09-21 v3
摘要
现有的视听条件视频预测最先进方法利用多模态随机网络与帧编码器的视听帧隐码来预测下一视觉帧。然而,由于高维图像空间,直接推断下一视觉帧的逐像素强度极具挑战。为此,我们将视听条件视频预测解耦为运动与外观建模。多模态运动估计基于视听相关性预测未来光流。视觉分支从由音频特征构建的运动记忆中回忆,以实现更好的长期预测。我们进一步提出上下文感知细化,以解决长期连续扭曲中全局外观上下文的衰减问题。全局外观上下文由上下文编码器提取,并在与扭曲帧特征融合前由运动条件仿射变换操控。实验结果表明,我们的方法在现有基准上取得了有竞争力的结果。
引用
@article{arxiv.2212.04679,
title = {Motion and Context-Aware Audio-Visual Conditioned Video Prediction},
author = {Yating Xu and Conghui Hu and Gim Hee Lee},
journal= {arXiv preprint arXiv:2212.04679},
year = {2023}
}
备注
BMVC 2023