中文

面向文本到图像生成的能力感知提示重写学习

计算与语言 2024-04-01 v1 人工智能 计算机视觉与模式识别 信息检索

摘要

文本到图像生成系统已成为艺术创作领域的革命性工具,能够以前所未有的便捷性将文本提示转化为视觉艺术。然而,这些系统的效能与用户提供的提示质量密切相关,这对不熟悉提示编写的用户构成了挑战。本文通过利用交互日志中的用户重写数据来开发自动提示重写模型,从而应对这一挑战。我们对这些日志的深入分析表明,用户的提示重写高度依赖于用户个体的能力,导致重写对的质量存在显著差异。为了有效地使用这些数据进行训练,我们引入了能力感知提示重写(CAPR)框架。CAPR 通过两个关键组件创新地将用户能力整合到重写过程中:条件重写模型(CRM)和可配置能力特征(CCF)。CRM 根据由 CCF 表示的指定用户能力重写提示。CCF 则提供了调整和引导 CRM 行为的灵活性。这使得 CAPR 能够有效地学习跨不同用户能力的多样化重写策略,并在推理过程中模拟高能力用户的重写。在标准文本到图像生成基准上的大量实验表明,CAPR 优于现有基线,且在未见过的系统上表现出卓越的鲁棒性。此外,全面的分析验证了各组件的有效性。CAPR 能够促进用户与文本到图像系统的友好交互,使更广泛的用户群体更容易实现高级艺术创作。

关键词

引用

@article{arxiv.2403.19716,
  title  = {Capability-aware Prompt Reformulation Learning for Text-to-Image Generation},
  author = {Jingtao Zhan and Qingyao Ai and Yiqun Liu and Jia Chen and Shaoping Ma},
  journal= {arXiv preprint arXiv:2403.19716},
  year   = {2024}
}

备注

Accepted at SIGIR 2024