BIGFix:基于 token 修正的双向图像生成
计算机视觉与模式识别
2025-10-15 v1
摘要
近期图像和视频生成技术的进展吸引了学界和产业界的广泛关注。该领域的关键挑战之一是提高推理效率,因为模型规模和推理步数直接影响生成模型的商业可行性,同时也构成了根本性的科学挑战。一个有前景的方向是将自回归顺序 token 模型与每步多 token 预测相结合,最多可将推理时间缩短一个数量级。然而,预测多个 token 并行会引入结构性不一致,由于在训练期间捕获复杂联合依赖仍具有挑战。传统上,一旦采样了 token,就没有机制可以回溯并修正错误预测。我们提出一种通过迭代细化采样 token 来实现自纠正图像生成的方法。我们通过一种新颖的训练方案注入随机 token,以提升鲁棒性并实现采样期间的 token 修正。我们的方法保留了并行 token 预测的效率优势,同时显著提升生成质量。我们在 ImageNet-256 和 CIFAR-10 数据集上进行图像生成评估,以及在 UCF-101 和 NuScenes 上进行视频生成评估,结果在两种模态上均显示出显著改进。
引用
@article{arxiv.2510.12231,
title = {BIGFix: Bidirectional Image Generation with Token Fixing},
author = {Victor Besnier and David Hurych and Andrei Bursuc and Eduardo Valle},
journal= {arXiv preprint arXiv:2510.12231},
year = {2025}
}