中文

跟随信息流动:文本到图像模型中文本标记间信息传递机制

计算与语言 2026-04-20 v3

摘要

文本到图像生成模型存在对齐问题,生成的图像未能准确捕捉文本提示中的对象和关系。现有研究侧重通过优化扩散过程来改善对齐,忽视了引导扩散过程的文本编码器所发挥的作用。本文我们研究了语义信息在文本提示中跨标记表示的分布方式,分别从两个层面进行分析:(1)项目内表示—— individual tokens 是否代表其词汇单元(即传递单个概念的词或短语);(2)跨项目交互——不同词汇单元之间是否存在信息传递。我们采用补丁技术揭示编码模式,发现信息通常集中于单个或两个标记中;例如,在词汇单元 "San Francisco's Golden Gate Bridge" 中,标记 "Gate" 足以完整捕捉该表达,而其他标记可有效被舍弃。词汇单元倾向于保持孤立;例如,在提示 "a green dog" 中,标记 "dog" 不编码关于 "green" 的视觉信息。然而,在某些情况下,项目确实会相互影响其表示,常导致误解——例如,在提示 "a pool by a table" 中,标记 "pool" 在语境化后表示 "pool table"。我们的发现凸显了标记级编码在图像生成中的关键作用,证明了在编码阶段进行简单干预即可显著提高对齐度和生成质量。

关键词

引用

@article{arxiv.2504.01137,
  title  = {Follow the Flow: On Information Flow Across Textual Tokens in Text-to-Image Models},
  author = {Guy Kaplan and Michael Toker and Yuval Reif and Yonatan Belinkov and Roy Schwartz},
  journal= {arXiv preprint arXiv:2504.01137},
  year   = {2026}
}

备注

Accepted to ACL 2026