跟随信息流动:文本到图像模型中文本标记间信息传递机制
计算与语言
2026-04-20 v3
摘要
文本到图像生成模型存在对齐问题,生成的图像未能准确捕捉文本提示中的对象和关系。现有研究侧重通过优化扩散过程来改善对齐,忽视了引导扩散过程的文本编码器所发挥的作用。本文我们研究了语义信息在文本提示中跨标记表示的分布方式,分别从两个层面进行分析:(1)项目内表示—— individual tokens 是否代表其词汇单元(即传递单个概念的词或短语);(2)跨项目交互——不同词汇单元之间是否存在信息传递。我们采用补丁技术揭示编码模式,发现信息通常集中于单个或两个标记中;例如,在词汇单元 "San Francisco's Golden Gate Bridge" 中,标记 "Gate" 足以完整捕捉该表达,而其他标记可有效被舍弃。词汇单元倾向于保持孤立;例如,在提示 "a green dog" 中,标记 "dog" 不编码关于 "green" 的视觉信息。然而,在某些情况下,项目确实会相互影响其表示,常导致误解——例如,在提示 "a pool by a table" 中,标记 "pool" 在语境化后表示 "pool table"。我们的发现凸显了标记级编码在图像生成中的关键作用,证明了在编码阶段进行简单干预即可显著提高对齐度和生成质量。
引用
@article{arxiv.2504.01137,
title = {Follow the Flow: On Information Flow Across Textual Tokens in Text-to-Image Models},
author = {Guy Kaplan and Michael Toker and Yuval Reif and Yonatan Belinkov and Roy Schwartz},
journal= {arXiv preprint arXiv:2504.01137},
year = {2026}
}
备注
Accepted to ACL 2026