Lyra:面向 Omni-Cognition 的高效语音导向框架
计算机视觉与模式识别
2024-12-13 v1 多媒体
摘要
随着多模态大语言模型 (MLLM) 的演进,超越单一领域的能力已成为满足更灵活和高效 AI 需求的关键。然而,前述 Omni 模型在语音集成方面不足,忽视了其与多模态的融合。我们引入 Lyra,一个高效 MLLM,通过三种策略提升其多模态能力,包括先进的长语音理解、声音理解、跨模态效率以及无缝语音交互。为实现效率和语音导向能力,Lyra 采用三种策略:(1)利用现有的开源大型模型和提出的多模态 LoRA 以降低训练成本和数据需求;(2)使用潜在多模态正则化器和提取器以强化语音与其他模态之间的关系,从而提升模型性能;(3)构建包含 150 万个多模态 (语言、视觉、音频) 数据样本和 1.2 万个长语音样本的高质量、广泛的数据集,使 Lyra 能够处理复杂的长语音输入并实现更稳健的 omni-cognition。与其他 Omni 方法相比,Lyra 在各种视觉-语言、视觉-语音和语音-语言基准测试中实现了最先进的性能,同时使用更少的计算资源和更少的训练数据。
引用
@article{arxiv.2412.09501,
title = {Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition},
author = {Zhisheng Zhong and Chengyao Wang and Yuqi Liu and Senqiao Yang and Longxiang Tang and Yuechen Zhang and Jingyao Li and Tianyuan Qu and Yanwei Li and Yukang Chen and Shaozuo Yu and Sitong Wu and Eric Lo and Shu Liu and Jiaya Jia},
journal= {arXiv preprint arXiv:2412.09501},
year = {2024}
}
备注
Tech report