SparrowVQE:面向课程内容理解的视觉问题解释
计算机视觉与模式识别
2024-11-13 v1 计算与语言
摘要
视觉问答(VQA)研究旨在创建能回答图像中自然语言问题的 AI 系统,但 VQA 方法往往产生过于简单简短的答案。本文旨在通过引入视觉问题解释(VQE)推动该领域发展,增强 VQA 提供详细解释而非简短回答的能力,满足与视觉内容进行更复杂交互的需求。我们首先从一个为期 14 周的流式视频机器学习课程创建了 MLVQE 数据集,包含 885 张幻灯片图像、110,407 词的转录文本和 9,416 个设计的问答(QA)对。接着,我们提出了一种新颖的 SparrowVQE,一个 30 亿参数的小型多模态模型。我们采用三阶段训练机制训练模型,包括多模态预训练(幻灯片图像与转录文本特征对齐)、指令微调(用转录文本和 QA 对微调预训练模型)和领域微调(用幻灯片图像和 QA 对微调)。最终,我们的 SparrowVQE 能利用 SigLIP 模型理解和连接视觉信息,结合 Phi-2 语言模型处理转录文本,通过 MLP 适配器融合。实验结果表明,我们的 SparrowVQE 在我们开发的 MLVQE 数据集上取得更好性能,并在其他五个基准 VQA 数据集上超越最先进方法。源代码可在 \url{https://github.com/YoushanZhang/SparrowVQE} 获取。
引用
@article{arxiv.2411.07516,
title = {SparrowVQE: Visual Question Explanation for Course Content Understanding},
author = {Jialu Li and Manish Kumar Thota and Ruslan Gokhman and Radek Holik and Youshan Zhang},
journal= {arXiv preprint arXiv:2411.07516},
year = {2024}
}