填充语调:T2I 模型中填充 Token 的机制分析
计算与语言
2025-03-04 v2 计算机视觉与模式识别
摘要
文本到图像(T2I)扩散模型依赖编码后的提示词来引导图像生成过程。通常,这些提示词在文本编码前会通过添加填充 token 扩展至固定长度。尽管这是一种默认做法,但填充 token 对图像生成过程的影响尚未被研究。在这项工作中,我们首次深入分析了填充 token 在T2I模型中扮演的角色。我们开发了两种因果技术,用于分析信息如何编码在T2I流水线不同组件中 token 的表示里。利用这些技术,我们研究了填充 token 何时以及如何影响图像生成过程。我们的发现揭示了三种不同场景:填充 token 可能在文本编码期间、在扩散过程中影响模型输出,或者被有效忽略。此外,我们确定了这些场景与模型架构(交叉注意力或自注意力)及其训练过程(冻结或已训练的文本编码器)之间的关键关系。这些见解有助于更深入地理解填充 token 的机制,可能为T2I系统中未来的模型设计和训练实践提供参考。
引用
@article{arxiv.2501.06751,
title = {Padding Tone: A Mechanistic Analysis of Padding Tokens in T2I Models},
author = {Michael Toker and Ido Galil and Hadas Orgad and Rinon Gal and Yoad Tewel and Gal Chechik and Yonatan Belinkov},
journal= {arXiv preprint arXiv:2501.06751},
year = {2025}
}
备注
Published in: NAACL 2025. Project webpage: https://padding-tone.github.io/