视觉-语音模型:教育语音模型就图像进行对话
计算机视觉与模式识别
2025-03-21 v1
摘要
近期视觉语言模型的成功引发了一个重要问题:如何为预训练语音模型等价地赋予视觉理解能力,这是通向能够自由就图像进行对话的多模态语音模型的重要里程碑。构建此类对话式视觉-语音模型带来了独特的挑战:(i) 成对的图像-语音数据远不如其图像-文本对应物稀缺,(ii) 在推理过程中确保实时延迟至关重要,从而带来计算和内存限制,(iii) 模型应保留语音特征(如说话人语调),这些特征无法仅从文本推断得出。本文我们引入 MoshiVis,通过轻量级适应模块为最近的对话式语音大语言模型 Moshi 引入视觉输入。额外的动态门控机制使模型更容易在视觉输入与无关对话话题之间切换。为减少训练成本,我们设计了简单的单阶段、参数高效的微调管道,其中我们利用图像-文本(即“无语音”)和图像-语音样本的混合。我们在使用音频和文本提示进行下游视觉理解任务评估该模型,并报告了与 MoshiVis 交互的定性样本。我们的推理代码将公开,以及用于音频评估的图像-语音数据。
引用
@article{arxiv.2503.15633,
title = {Vision-Speech Models: Teaching Speech Models to Converse about Images},
author = {Amélie Royer and Moritz Böhle and Gabriel de Marmiesse and Laurent Mazaré and Neil Zeghidour and Alexandre Défossez and Patrick Pérez},
journal= {arXiv preprint arXiv:2503.15633},
year = {2025}
}