中文

Qwen3.5-Omni 技术报告

计算与语言 2026-04-22 v2 音频与语音处理

摘要

本工作提出 Qwen3.5-Omni,即 Qwen-Omni 模型家族的最新进展。相较于前一代模型,Qwen3.5-Omni 规模达数千亿参数,支持 256k 上下文长度。该模型利用由异构文本-视觉配对及 100 多万小时音视频内容构成的海量数据集,展现出强大的全模态能力。Qwen3.5-Omni-plus 在 215 项音频和音视频理解、推理与交互子任务中实现 SOTA 成绩,超越 Gemini-3.1 Pro 在关键音频任务中,并在综合音视频理解方面与之相当。架构上,Qwen3.5-Omni 采用混合注意力 Mixture-of-Experts(MoE)框架用于 Thinker 与 Talker,实现高效的长序列推理。该模型支持复杂交互,支持 10 小时音频理解和 400 秒 720P 视频(以 1 FPS 速率)。为解决文本和语音标记器编码效率差异导致的流式语音合成不稳定和不自然的问题,我们引入 ARIA。ARIA 动态对齐文本和语音单元,显著提升了带来最小延迟的对话语音的稳定性和韵律。此外,Qwen3.5-Omni 扩展了语言边界,支持 10 种语言的理解与语音生成,展现出人类般的情感细腻度。最后,Qwen3.5-Omni 在音视频定位方面表现卓越,能够生成带有精确时间同步和自动场景分段的脚本级结构化标题。值得注意的是,我们观察到全模态模型的一种新能力:直接基于音视频指令进行编码,这我们称为 Audio-Visual Vibe Coding。

关键词

引用

@article{arxiv.2604.15804,
  title  = {Qwen3.5-Omni Technical Report},
  author = {Qwen Team},
  journal= {arXiv preprint arXiv:2604.15804},
  year   = {2026}
}