中文

基于作者写作风格的个性化图像生成

计算机视觉与模式识别 2025-07-08 v1 人工智能

摘要

将细腻、文本定义的作者写作风格转化为引人注目的视觉表征,是生成式 AI 中的一个新颖挑战。本文引入了一个管道,利用作者写作表(Author Writing Sheets, AWS)——作者文学特征的结构化概述——作为大型语言模型(LLM, Claude 3.7 Sonnet)的输入。LLM 解释 AWS 生成三个独特的、具描述性的文本到图像提示,然后由扩散模型(Stable Diffusion 3.5 Medium)进行渲染。我们使用来自 Reddit 数据的 49 种作者风格进行评估,人类评估者评估生成图像的风格匹配度和视觉独特性。结果表明,生成的视觉内容与文本化作者档案之间存在良好的感知对齐(平均风格匹配度:4.08/54.08/5),图像被评定为中等程度的独特性。定性分析进一步突出了该管道捕捉情绪和氛围的能力,同时也确定了在表示高度抽象叙事元素方面的挑战。这一工作贡献了一种新的端到端方法,用于视觉作者风格个性化,并提供了初始的实证验证,为创意辅助和跨模态理解等应用开辟了研究方向。

关键词

引用

@article{arxiv.2507.03313,
  title  = {Personalized Image Generation from an Author Writing Style},
  author = {Sagar Gandhi and Vishal Gandhi},
  journal= {arXiv preprint arXiv:2507.03313},
  year   = {2025}
}