Numina:文本数字与视觉实例在文本到视频扩散模型中的对齐
计算机视觉与模式识别
2026-04-10 v1
摘要
文本到视频扩散模型已实现开放式视频合成,但常常在生成正确数量的物体方面困难——即按照提示中指定的数量进行生成。我们引入了 NUMINA,一个无需训练的识别-引导框架,用于改进数值对齐。NUMINA 通过选择判别性自注意力和交叉注意力头,从而派生出可计数的潜在布局,以识别提示-布局之间的不一致。随后,该布局保守地被细化,并调制交叉注意力以引导再生。在我们引入的 CountBench 上,NUMINA 在 Wan2.1-1.3B 模型上提高了计数准确率最高可达 7.4%,在 5B 和 14B 模型上分别提高了 4.9% 和 5.5%。此外,在保持时间一致性的同时,CLIP 对齐效果得到改善。这些结果表明,结构引导补充了种子搜索和提示增强,为实现准确的文本到视频扩散提供了实用的路径。代码已公开:https://github.com/H-EmbodVis/NUMINA。
引用
@article{arxiv.2604.08546,
title = {When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models},
author = {Zhengyang Sun and Yu Chen and Xin Zhou and Xiaofan Li and Xiwu Chen and Dingkang Liang and Xiang Bai},
journal= {arXiv preprint arXiv:2604.08546},
year = {2026}
}
备注
Accepted by CVPR 2026. Project page: https://h-embodvis.github.io/NUMINA