中文

正确为我着色:桥接感知颜色空间与文本嵌入以改进扩散生成

计算机视觉与模式识别 2025-09-15 v1

摘要

在文本到图像(T2I)生成中,准确的颜色对齐对于时尚、产品可视化与室内设计等应用至关重要,然而当前的扩散模型在处理细微与复合颜色术语(如蒂芙尼蓝、酸橙绿、热粉红)时存在困难,常生成与人类意图不符的图像。现有方法依赖于交叉注意力操纵、参考图像或微调,但无法系统性地解决模糊的颜色描述。为了在提示模糊时精确渲染颜色,我们提出了一个免训练框架,该框架利用大型语言模型(LLM)消除颜色相关提示的歧义,并直接在文本嵌入空间中引导颜色混合操作,从而增强颜色保真度。该方法首先利用大型语言模型(LLM)解析文本提示中模糊的颜色术语,随后根据所得颜色术语在 CIELAB 颜色空间中的空间关系优化文本嵌入。与以往方法不同,我们的方法无需额外训练或外部参考图像即可提高颜色准确度。实验结果表明,我们的框架在不损害图像质量的前提下改善了颜色对齐,弥合了文本语义与视觉生成之间的差距。

关键词

引用

@article{arxiv.2509.10058,
  title  = {Color Me Correctly: Bridging Perceptual Color Spaces and Text Embeddings for Improved Diffusion Generation},
  author = {Sung-Lin Tsai and Bo-Lun Huang and Yu Ting Shen and Cheng Yu Yeo and Chiang Tseng and Bo-Kai Ruan and Wen-Sheng Lien and Hong-Han Shuai},
  journal= {arXiv preprint arXiv:2509.10058},
  year   = {2025}
}

备注

Accepted to ACM Multimedia 2025 (MM '25)