中文

UniT: 统一多模态链式思考测试时扩展

计算机视觉与模式识别 2026-02-13 v1 人工智能 机器学习

摘要

统一模型能够在单一架构中处理多模态理解与生成,但通常以单次前向传播运行,无法迭代细化输出。许多多模态任务,尤其是涉及复杂空间构图、多个相互作用对象或演化指令的任务,需要分解指令、验证中间结果并进行迭代纠正。虽然测试时扩展(TTS)已证明为分配额外推理计算可显著提升语言模型性能,但将这一范式扩展到统一多模态模型仍是开放挑战。我们引入UniT,一种多模态链式思考测试时扩展框架,使单一统一模型能够跨多个推理轮进行推理、验证和细化。UniT融合了智能数据合成、统一模型训练和灵活的测试时推理,以激发包括验证、子目标分解和内容记忆在内的认知行为。我们的关键发现表明:(1)在短推理轨迹上训练的统一模型可在测试时推理更长的链路;(2)顺序链式思考推理比并行采样更具可扩展性和计算效率;(3)在生成与编辑轨迹上进行训练可提升样本外视觉推理能力。这些结果确立了多模态测试时扩展作为推进统一模型生成与理解能力的有效范式。

关键词

引用

@article{arxiv.2602.12279,
  title  = {UniT: Unified Multimodal Chain-of-Thought Test-time Scaling},
  author = {Leon Liangyu Chen and Haoyu Ma and Zhipeng Fan and Ziqi Huang and Animesh Sinha and Xiaoliang Dai and Jialiang Wang and Zecheng He and Jianwei Yang and Chunyuan Li and Junzhe Sun and Chu Wang and Serena Yeung-Levy and Felix Juefei-Xu},
  journal= {arXiv preprint arXiv:2602.12279},
  year   = {2026}
}