STRIVE:视频中的场景文本替换
计算机视觉与模式识别
2021-09-08 v1
摘要
我们提出利用深度风格迁移与学习到的光度变换来替换视频中的场景文本。基于近期静态图像文本替换的进展,我们给出了在改变文本的同时保留原始视频外观与运动特性的扩展。相较于静态图像文本替换问题,我们的方法解决了视频引入的额外挑战,即由光照变化、运动模糊、随时间产生的相机-物体位姿多样变化以及时间一致性保持所引起的效果。我们将该问题解析为三个步骤。首先,利用时空变换网络将所有帧中的文本归一化为正面位姿。其次,使用最先进的静态图像文本替换方法在单一参考帧中替换文本。最后,利用一种新颖的学习图像变换网络将新文本从参考帧转移到其余帧,该网络以时间一致的方式捕捉光照与模糊效果。在合成与具有挑战性的真实视频上的结果表明了逼真的文本迁移、有竞争力的定量与定性性能,以及相对于替代方法的更优推理速度。我们引入了带有配对文本对象的新合成与真实世界数据集。据我们所知,这是首次尝试深度视频文本替换。
引用
@article{arxiv.2109.02762,
title = {STRIVE: Scene Text Replacement In Videos},
author = {Vijay Kumar B G and Jeyasri Subramanian and Varnith Chordia and Eugene Bart and Shaobo Fang and Kelly Guan and Raja Bala},
journal= {arXiv preprint arXiv:2109.02762},
year = {2021}
}
备注
ICCV 2021, Project Page: https://striveiccv2021.github.io/STRIVE-ICCV2021/