ANCHOR: 基于LLM的主体条件文本到图像合成
计算机视觉与模式识别
2026-04-28 v2 计算与语言
多媒体
摘要
文本到图像(T2I)模型在高质量图像合成方面取得了显著进展,然而大多数基准测试依赖于简单、自包含的提示,未能捕捉真实世界标题的复杂性。人类编写的标题通常涉及多个交互主体、丰富的上下文引用和抽象措辞,在这些条件下,当前的图像-文本编码器(如CLIP)表现不佳。为了系统地研究这些缺陷,我们引入了ANCHOR,一个包含来自五家主要新闻媒体机构的70K+抽象标题的大规模数据集。使用ANCHOR的分析揭示了在多主体理解、上下文推理和细粒度基础方面的持续失败。受这些挑战的启发,我们提出了主体感知微调(SAFE),它利用大型语言模型(LLM)提取关键主体并在嵌入层面增强其表示。与当代模型的实验表明,SAFE显著提高了图像-标题一致性和人类偏好对齐,是一种实用且可扩展的解决方案。
引用
@article{arxiv.2404.10141,
title = {ANCHOR: LLM-driven Subject Conditioning for Text-to-Image Synthesis},
author = {Aashish Anantha Ramakrishnan and Sharon X. Huang and Dongwon Lee},
journal= {arXiv preprint arXiv:2404.10141},
year = {2026}
}
备注
Accepted to The 64th Annual Meeting of the Association for Computational Linguistics (ACL) 2026