文本引导的神经图像修复
计算机视觉与模式识别
2021-03-23 v4 计算与语言
摘要
图像修复任务要求用与上下文连贯的内容填补受损图像。该研究领域借助神经图像修复方法已取得可喜进展。然而,仅依靠上下文像素来推测缺失内容仍是一项关键挑战。本文的目标是根据所提供的描述性文本,填补受损图像中的语义信息。与现有的文本引导图像生成工作不同,修复模型需要比较给定文本的语义内容与图像的剩余部分,然后找出缺失部分应填补的语义内容。为完成此任务,我们提出了一种名为文本引导双注意力修复网络(TDANet)的新型修复模型。首先,设计了一种双多模态注意力机制,通过比较描述性文本与互补图像区域(借助互注意力)来提取关于受损区域的显式语义信息。其次,应用图文匹配损失来最大化生成图像与文本之间的语义相似度。在两个公开数据集上进行了实验。结果表明,所提出的 TDANet 模型在定量与定性指标上均达到了新的 SOTA。结果分析表明,生成的图像与引导文本一致,通过提供不同的描述可生成多种结果。代码见 https://github.com/idealwhite/TDANet
引用
@article{arxiv.2004.03212,
title = {Text-Guided Neural Image Inpainting},
author = {Lisai Zhang and Qingcai Chen and Baotian Hu and Shuoran Jiang},
journal= {arXiv preprint arXiv:2004.03212},
year = {2021}
}
备注
ACM MM'2020 (Oral). 9 pages, 4 tables, 7 figures