OpenOmni:通过渐进式多模态对齐和实时自感知情感语音合成推进开源全模态大语言模型
计算与语言
2025-09-24 v6 计算机视觉与模式识别
摘要
全模态学习的最新进展显著提高了跨图像、文本和语音的理解与生成能力,然而这些发展仍然主要局限于专有模型。高质量全模态数据集的缺乏以及实时情感语音合成的挑战显著阻碍了开源研究的进展。为了解决这些限制,我们引入了\name,一个两阶段训练框架,集成了全模态对齐和语音生成,以开发最先进的全模态大语言模型。在对齐阶段,预训练语音模型在文本-图像任务上进一步训练,实现了从视觉到语音的(接近)零样本泛化,优于在三模态数据集上训练的模型。在语音生成阶段,一个轻量级解码器通过直接偏好优化在语音任务上训练,实现了高保真度的实时情感语音合成。实验表明,\name在全模态、视觉-语言和语音-语言基准测试中超越了最先进的模型。它在OmniBench上比领先的开源模型VITA绝对提高了4个百分点,尽管使用的训练样本少5倍,模型尺寸更小(7B vs. 7x8B)。此外,\name在非自回归模式下实现了<1秒延迟的实时语音生成,推理时间比自回归方法减少5倍,情感分类准确率提高7.7%。
引用
@article{arxiv.2501.04561,
title = {OpenOmni: Advancing Open-Source Omnimodal Large Language Models with Progressive Multimodal Alignment and Real-Time Self-Aware Emotional Speech Synthesis},
author = {Run Luo and Ting-En Lin and Haonan Zhang and Yuchuan Wu and Xiong Liu and Min Yang and Yongbin Li and Longze Chen and Jiaming Li and Lei Zhang and Xiaobo Xia and Hamid Alinejad-Rokny and Fei Huang},
journal= {arXiv preprint arXiv:2501.04561},
year = {2025}
}