AceTone: bridging words and colors for conditional image grading
计算机视觉与模式识别
2026-04-02 v1
摘要
颜色影响我们对图像风格和情感的解读。先前的颜色调色方法依赖于基于补丁的重新着色或固定滤波器组,难以在创意意图之间泛化,也难以与人类审美偏好保持一致。本研究提出AceTone,首个支持多模态条件颜色调色的统一框架。AceTone将调色建模为生成式颜色转换任务,模型直接产生3D-LUT(Look-Up Table)条件于文本提示或参考图像。我们开发了一个基于VQ-VAE的tokenizer,将 LUT向量压缩为64个离散token,保真度达到。我们进一步构建了一个大型数据集AceTone-800K,并训练一个视觉语言模型来预测LUT token,随后通过强化学习对输出进行感知保真度和审美对齐。实验表明,AceTone在文本引导和参考引导的调色任务上均实现最先进性能,LPIPS提升了最高可达50%。人类评估确认,AceTone的结果在视觉上令人愉悦且风格连贯,展示了一条面向语言驱动、审美对齐颜色调色的新途径。
引用
@article{arxiv.2604.00530,
title = {AceTone: Bridging Words and Colors for Conditional Image Grading},
author = {Tianren Ma and Mingxiang Liao and Xijin Zhang and Qixiang Ye},
journal= {arXiv preprint arXiv:2604.00530},
year = {2026}
}
备注
Accepted by CVPR 2026. Project Page: github.com/martian422/AceTone