中文

填充语调:T2I 模型中填充 Token 的机制分析

计算与语言 2025-03-04 v2 计算机视觉与模式识别

摘要

文本到图像(T2I)扩散模型依赖编码后的提示词来引导图像生成过程。通常,这些提示词在文本编码前会通过添加填充 token 扩展至固定长度。尽管这是一种默认做法,但填充 token 对图像生成过程的影响尚未被研究。在这项工作中,我们首次深入分析了填充 token 在T2I模型中扮演的角色。我们开发了两种因果技术,用于分析信息如何编码在T2I流水线不同组件中 token 的表示里。利用这些技术,我们研究了填充 token 何时以及如何影响图像生成过程。我们的发现揭示了三种不同场景:填充 token 可能在文本编码期间、在扩散过程中影响模型输出,或者被有效忽略。此外,我们确定了这些场景与模型架构(交叉注意力或自注意力)及其训练过程(冻结或已训练的文本编码器)之间的关键关系。这些见解有助于更深入地理解填充 token 的机制,可能为T2I系统中未来的模型设计和训练实践提供参考。

关键词

引用

@article{arxiv.2501.06751,
  title  = {Padding Tone: A Mechanistic Analysis of Padding Tokens in T2I Models},
  author = {Michael Toker and Ido Galil and Hadas Orgad and Rinon Gal and Yoad Tewel and Gal Chechik and Yonatan Belinkov},
  journal= {arXiv preprint arXiv:2501.06751},
  year   = {2025}
}

备注

Published in: NAACL 2025. Project webpage: https://padding-tone.github.io/