基于 Transformer 的图像和视频填充:当前挑战与未来方向
计算机视觉与模式识别
2025-02-07 v1
摘要
图像填充目前是计算机视觉领域的热门话题。它为包括照片修复、视频编辑和医学成像在内的各种应用提供了可行解决方案。深度学习的进展,尤其是卷积神经网络 (CNN) 和生成对抗网络 (GAN),显著提升了填充任务的能力,能够通过纳入上下文相关细节来填充图像或视频中被遗失或损坏的区域。这些进展还提升了其他方面,包括效率、信息保留以及实现真实纹理和结构。最近,视觉 Transformer 被用于图像或视频填充,取得了一些改进。基于 Transformer 的架构最初为自然语言处理设计,其在计算机视觉任务中的集成也日益增多。这些方法利用自注意力机制在捕获数据中长程依赖方面表现突出,特别适用于需要全面理解图像或视频全局上下文的任务。本文综述了当前的图像或视频填充方法,特别关注基于 Transformer 的技术,旨在突出显著改进,并为图像或视频填充领域的新研究者提供指南。我们按架构配置、损伤类型和性能指标对基于 Transformer 的技术进行分类。此外,我们系统性地综述了当前挑战,并提出了未来研究的方向。
关键词
引用
@article{arxiv.2407.00226,
title = {Transformer-based Image and Video Inpainting: Current Challenges and Future Directions},
author = {Omar Elharrouss and Rafat Damseh and Abdelkader Nasreddine Belkacem and Elarbi Badidi and Abderrahmane Lakas},
journal= {arXiv preprint arXiv:2407.00226},
year = {2025}
}
备注
The paper have been submitted to Artificial Intelligence Review journal