由音视频自监督引导的深度视频修复
音频与语音处理
2023-10-12 v1 计算机视觉与模式识别
声音
摘要
人类可以基于其对音视频事件的先验知识,轻易地从听觉信息想象出场景。本文中,我们在深度学习模型中模仿这一人类 innate 能力以提升视频修复质量。为实现该先验知识,我们首先训练音视频网络,其学习听觉与视觉信息间的对应关系。随后,该音视频网络被用作引导器,将音视频对应关系的先验知识传递给视频修复网络。该先验知识通过我们提出的两个新颖损失传递:音视频注意力损失与音视频伪类一致性损失。这两个损失通过促使修复结果与同步音频具有高对应性,进一步提升了视频修复性能。实验结果表明,我们提出的方法可恢复更广域的视频场景,并在场景中发声物体部分被遮挡时尤为有效。
引用
@article{arxiv.2310.07663,
title = {Deep Video Inpainting Guided by Audio-Visual Self-Supervision},
author = {Kyuyeon Kim and Junsik Jung and Woo Jae Kim and Sung-Eui Yoon},
journal= {arXiv preprint arXiv:2310.07663},
year = {2023}
}
备注
Accepted at ICASSP 2022