中文

自回归模型的视觉自细化

计算机视觉与模式识别 2025-10-02 v1

摘要

自回归模型在序列建模方面表现出色,已被证明对视觉语言数据有效。然而,视觉信号的空间性质与下一个标记预测的序列依赖性相冲突,导致结果次佳。本工作提出一种即插即用的细化模块,以增强生成视觉序列中复杂的空间对应关系建模。该模块作为后预训练步骤,联合细化自回归模型生成的所有标记,提升了受共享序列预测框架约束下的视觉语言建模。通过利用标记之间的全局上下文和关系,我们的方法缓解了序列生成中的错误累积问题。实验表明,所提方法提高了生成质量,增强了模型产生语义一致结果的能力。

关键词

引用

@article{arxiv.2510.00993,
  title  = {Visual Self-Refinement for Autoregressive Models},
  author = {Jiamian Wang and Ziqi Zhou and Chaithanya Kumar Mummadi and Sohail Dianat and Majid Rabbani and Raghuveer Rao and Chen Qiu and Zhiqiang Tao},
  journal= {arXiv preprint arXiv:2510.00993},
  year   = {2025}
}

备注

Accepted by EMNLP2025