AR-Omni:面向任意-任意生成的统一自回归模型
机器学习
2026-01-27 v1 人工智能
计算与语言
摘要
现实世界的感知与交互本质上是多模态的,涵盖不仅仅是语言,还包括视觉和语音,这促使发展支持多模态输入和多模态输出的“Omni”类大语言模型。虽然一系列Omni类大语言模型相继出现,但大多数现有系统仍依赖额外的专家组件来实现多模态生成,限制了统一训练和推理的简单性。自回归(AR)建模具有单一token流、单一下一个token目标和单一解码器,是文本领域中优雅且可扩展的基础。基于此,我们提出AR-Omni,一种在自回归范式下无需任何专家解码器的统一的任意-任意模型。AR-Omni支持自回归文本和图像生成,以及流式语音生成,全部在单个Transformer解码器下实现。我们进一步解决统一AR建模中的三个实际问题:通过任务感知损失重加权处理模态不平衡问题,为图像token引入轻量级token级感知对齐损失以提升视觉保真度,以及通过有限状态解码机制平衡稳定性与创造性之间的权衡。经验上,AR-Omni在三个模态上均实现了卓越的质量,同时保持实时性,在语音生成中实现0.88的实时因子。
引用
@article{arxiv.2601.17761,
title = {AR-Omni: A Unified Autoregressive Model for Any-to-Any Generation},
author = {Dongjie Cheng and Ruifeng Yuan and Yongqi Li and Runyang You and Wenjie Wang and Liqiang Nie and Lei Zhang and Wenjie Li},
journal= {arXiv preprint arXiv:2601.17761},
year = {2026}
}