基于作者写作风格的个性化图像生成
计算机视觉与模式识别
2025-07-08 v1 人工智能
摘要
将细腻、文本定义的作者写作风格转化为引人注目的视觉表征,是生成式 AI 中的一个新颖挑战。本文引入了一个管道,利用作者写作表(Author Writing Sheets, AWS)——作者文学特征的结构化概述——作为大型语言模型(LLM, Claude 3.7 Sonnet)的输入。LLM 解释 AWS 生成三个独特的、具描述性的文本到图像提示,然后由扩散模型(Stable Diffusion 3.5 Medium)进行渲染。我们使用来自 Reddit 数据的 49 种作者风格进行评估,人类评估者评估生成图像的风格匹配度和视觉独特性。结果表明,生成的视觉内容与文本化作者档案之间存在良好的感知对齐(平均风格匹配度:),图像被评定为中等程度的独特性。定性分析进一步突出了该管道捕捉情绪和氛围的能力,同时也确定了在表示高度抽象叙事元素方面的挑战。这一工作贡献了一种新的端到端方法,用于视觉作者风格个性化,并提供了初始的实证验证,为创意辅助和跨模态理解等应用开辟了研究方向。
引用
@article{arxiv.2507.03313,
title = {Personalized Image Generation from an Author Writing Style},
author = {Sagar Gandhi and Vishal Gandhi},
journal= {arXiv preprint arXiv:2507.03313},
year = {2025}
}