基于时间聚合与递归的深层盲视频去字幕
计算机视觉与模式识别
2019-05-09 v1
摘要
盲视频去字幕是在无任何输入掩码的情况下自动去除视频中文字叠加并修复被遮挡部分的问题。尽管近期基于深度学习的修复方法处理单幅图像且大多假设受损像素位置已知,我们旨在无掩码信息的视频序列中自动去除文字。本文提出一种简单而有效的快速盲视频去字幕框架。我们构建编码-解码模型,其中编码器接收可提供由场景动态揭示的可见像素的多个源帧。这些线索被聚合并送入解码器。我们应用从输入帧到解码器输出的残差连接,以迫使网络仅关注受损区域。我们提出的模型在 ECCV Chalearn 2018 LAP 修复竞赛 Track2:视频去字幕中排名第一。此外,我们通过应用递归反馈进一步改进这一强模型。递归反馈不仅增强时间一致性,还就受损像素位于何处提供强线索。定性与定量实验均表明,我们的完整模型实时(50+ fps)产生准确且时间一致的视频结果。
引用
@article{arxiv.1905.02949,
title = {Deep Blind Video Decaptioning by Temporal Aggregation and Recurrence},
author = {Dahun Kim and Sanghyun Woo and Joon-Young Lee and In So Kweon},
journal= {arXiv preprint arXiv:1905.02949},
year = {2019}
}
备注
Accepted at CVPR 2019