MMC:基于文本描述的多模态图像彩色化
计算机视觉与模式识别
2023-04-26 v2 多媒体
摘要
处理具有不同颜色的各种物体是图像彩色化技术的一大挑战。因此,对于复杂的真实世界场景,现有图像彩色化算法往往无法保持颜色一致性。本工作中,我们尝试将文本描述作为辅助条件,与待彩色化的灰度图像一起输入,以提升彩色化过程的保真度。为此,我们提出了一种深度网络,其接受两个输入(灰度图像与相应的编码文本描述)并尝试预测相关颜色分量。同时,我们对图像中每个物体进行预测,并依据各自的描述对其彩色化,以在彩色化过程中融入其特定属性。此后,一个融合模型融合所有图像物体(分割块)以生成最终彩色化图像。由于相应的文本描述包含图像中物体的颜色信息,文本编码有助于提升预测颜色的整体质量。在性能方面,所提方法在 LPIPS、PSNR 和 SSIM 指标上优于现有彩色化技术。
引用
@article{arxiv.2304.11993,
title = {MMC: Multi-Modal Colorization of Images using Textual Descriptions},
author = {Subhankar Ghosh and Saumik Bhattacharya and Prasun Roy and Umapada Pal and Michael Blumenstein},
journal= {arXiv preprint arXiv:2304.11993},
year = {2023}
}
备注
9 pages