构图你的美学:通过艺术法则赋能文本到图像模型
计算机视觉与模式识别
2025-03-18 v1 人工智能
摘要
文本到图像(T2I)扩散模型(DM)因其生成高保真输出的能力以及任何能将想象转化为语言的人都能使用而获得了广泛采用。然而,DMs往往倾向于生成不吸引人的输出,就像它们训练时所用的互联网上的随机图像一样。现有解决此问题的方法建立在视觉美学是普适的这一隐含前提之上,这是有局限性的。在T2I语境下,美学应当是关于个性化的,我们提出了美学对齐这一新任务,旨在将用户指定的美学与T2I生成输出对齐。受艺术作品为美学研究提供宝贵视角的启发,我们采用艺术家使用的构图框架——即艺术法则(Principles of Art, PoA)——来规范化视觉美学。为促进本研究,我们引入了CompArt,一个基于WikiArt的大规模构图艺术数据集,其PoA分析由强大的多模态LLM标注。利用LLM的表达能力并训练轻量且可迁移的适配器,我们证明T2I DMs可以通过用户指定的PoA条件有效提供10种构图控制。此外,我们设计了适当的评估框架来评估我们方法的有效性。
引用
@article{arxiv.2503.12018,
title = {Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art},
author = {Zhe Jin and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2503.12018},
year = {2025}
}