DoraCycle: 多模态循环中统一生成模型的领域导向适配
计算机视觉与模式识别
2025-03-06 v1
摘要
将生成模型适配到特定领域是满足专业化需求的有效解决方案。然而,适配某些复杂领域仍然具有挑战性,尤其是当这些领域需要大量配对数据来捕捉目标分布时。由于来自单一模态(如视觉或语言)的无配对数据更容易获取,我们利用统一生成模型学到的视觉与语言之间的双向映射,以实现在无配对数据上进行领域适配训练。具体而言,我们提出了DoraCycle,它整合了两个多模态循环:文本到图像到文本和图像到文本到图像。该模型通过循环端点处计算的交叉熵损失进行优化,两个端点共享同一模态。这促进了模型的自演化,而无需依赖标注的文本-图像对。实验结果表明,对于不依赖配对知识的任务(如风格化),DoraCycle可以仅使用无配对数据有效地适配统一模型。对于涉及新配对知识的任务(如特定身份),少量配对图像-文本示例与大规模无配对数据的组合足以实现有效的领域导向适配。代码将在https://github.com/showlab/DoraCycle发布。
引用
@article{arxiv.2503.03651,
title = {DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal Cycles},
author = {Rui Zhao and Weijia Mao and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2503.03651},
year = {2025}
}
备注
CVPR 2025