面向无文本视觉问答的统一语音-视觉多模态模型 SViQA
计算机视觉与模式识别
2025-04-03 v1 机器学习
摘要
整合语音和视觉的多模态模型在推进人机交互方面具有重要潜力,尤其是在语音驱动的视觉问答(SBVQA)中,即通过 spoken questions 关于 images 需要直接 audio-visual understanding。现有方法主要聚焦于 text-visual 集成,由于其固有的异构性,speech-visual 模态间的差距尚未得到充分探索。为此,我们引入 SViQA,一个统一的 speech-vision 模型,直接处理 spoken questions 而无需 text transcription。基于 LLaVA 架构,我们的框架通过两个关键创新实现听觉与视觉模态的桥接:(1) end-to-end speech feature extraction 消除中间 text 转换,(2) cross-modal alignment optimization 实现 speech signals 与 visual content 的有效融合。大量实验结果在 SBVQA benchmark 上表明,所提出的 SViQA 实现了业界最佳性能,达到75.62%的准确率,并展现出竞争的 multimodal generalization 能力。利用 speech-text 混合输入可将性能提升至78.85%,比纯 speech 输入高出3.23%,凸显了 SViQA 在增强鲁棒性和有效 cross-modal attention alignment 方面的优势。
关键词
引用
@article{arxiv.2504.01049,
title = {SViQA: A Unified Speech-Vision Multimodal Model for Textless Visual Question Answering},
author = {Bingxin Li},
journal= {arXiv preprint arXiv:2504.01049},
year = {2025}
}