SVLA:具备多模态推理与语音生成的统一语音-视觉-语言助手
多媒体
2025-07-08 v2
摘要
大型视觉与语言模型在图像描述、视觉问答和检索等任务中表现出色。然而,将语音、文本和视觉整合到统一模型中仍面临挑战,尤其是在语音任务中。语音生成方法各异(部分直接生成语音),其他方法则通过文本生成(但其对质量的影响尚不明确)。评估通常依赖自动语音识别,这可能引入偏差。我们提出 SVLA,一种基于 Transformer 架构的统一语音-视觉-语言模型,可处理多模态输入与输出。我们在 3820 万个语音-文本-图像样本上对其进行训练,其中包括 64.1 小时的合成语音。我们还引入了 Speech VQA Accuracy,一种用于评估语音响应的新指标。SVLA 通过更好地结合语音、视觉和语言,提升了多模态理解与生成能力。
引用
@article{arxiv.2503.24164,
title = {SVLA: A Unified Speech-Vision-Language Assistant with Multimodal Reasoning and Speech Generation},
author = {Ngoc Dung Huynh and Mohamed Reda Bouadjenek and Imran Razzak and Hakim Hacid and Sunil Aryal},
journal= {arXiv preprint arXiv:2503.24164},
year = {2025}
}
备注
21 pages