中文

GRAN-TED: 为扩散模型生成鲁棒、对齐且精细的文本嵌入

计算机视觉与模式识别 2025-12-30 v2

摘要

文本编码器是文本到图像和文本到视频扩散模型的关键组成部分,从根本上决定了生成内容的语义保真度。然而,其发展受到两大挑战的阻碍:缺乏能够可靠预测下游生成性能的高效评估框架,以及将预训练语言模型有效适配于视觉合成的困难。为了解决这些问题,我们提出了 GRAN-TED,即为扩散模型生成鲁棒、对齐且精细的文本嵌入。我们的贡献是双重的。首先,我们提出了 TED-6K,一个新型纯文本基准,能够在无需昂贵端到端模型训练的情况下,高效且鲁棒地评估编码器的表征质量。我们证明,在 TED-6K 上的性能经轻量统一适配器标准化后,与编码器在下游生成任务中的有效性强相关。值得注意的是,在我们的实验设置下,与从头训练扩散模型相比,使用 TED-6K 评估的速度约快 \textbf{750×\times} 倍。其次,在这一经过验证的框架指导下,我们通过一种新颖的两阶段训练范式开发了更优的文本编码器。该过程包括一个在多模态大语言模型上的初始微调阶段,以获得更好的视觉表征,随后采用逐层加权方法提取更精细且更有力的文本特征。我们的实验表明,由此产生的 GRAN-TED 编码器不仅在 TED-6K 上达到了最先进的性能,而且在文本到图像和文本到视频生成中也带来了显著的性能提升。我们的 TED-6K 数据集和评估代码可在以下链接获取:https://anonymous.4open.science/r/GRAN-TED-4FCC/。

关键词

引用

@article{arxiv.2512.15560,
  title  = {GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models},
  author = {Bozhou Li and Sihan Yang and Yushuo Guan and Ruichuan An and Xinlong Chen and Yang Shi and Pengfei Wan and Wentao Zhang and Yuanxing zhang},
  journal= {arXiv preprint arXiv:2512.15560},
  year   = {2025}
}