LANIT:面向无标注数据的语言驱动图像到图像翻译
计算机视觉与模式识别
2023-04-25 v4 人工智能
摘要
现有的图像到图像翻译技术通常受到两个关键问题的困扰:严重依赖逐样本的域标注,和/或无法处理每幅图像中的多个属性。近期真正的无监督方法采用聚类方法轻松提供逐样本的单热域标签。然而,它们无法应对真实世界的设定:一个样本可能具有多个属性。此外,聚类的语义不易与人类理解相耦合。为克服这些问题,我们提出一种语言驱动的图像到图像翻译模型,称为LANIT。我们利用数据集中以文本形式给出的易获取候选属性:图像与属性之间的相似度指示逐样本的域标签。该表述自然支持多热标签,从而用户可用一组语言属性指定目标域。为应对初始提示不准确的情况,我们还提出提示学习。我们进一步提出域正则化损失,强制翻译后的图像被映射到对应域。在多个标准基准上的实验表明,LANIT取得了与现有模型相当或更优的性能。
引用
@article{arxiv.2208.14889,
title = {LANIT: Language-Driven Image-to-Image Translation for Unlabeled Data},
author = {Jihye Park and Sunwoo Kim and Soohyun Kim and Seokju Cho and Jaejun Yoo and Youngjung Uh and Seungryong Kim},
journal= {arXiv preprint arXiv:2208.14889},
year = {2023}
}
备注
Accepted to CVPR 2023. Project Page: https://ku-cvlab.github.io/LANIT/