中文

利用多模态大语言模型提升以身体姿态视频为导向的问答能力

计算机视觉与模式识别 2025-04-08 v1 人工智能 机器学习 机器人学

摘要

以身体姿态视频为导向的问答 (Video Question Answering, QA) 需要模型处理长时段时间推理、第一人称视角以及频繁相机运动等专门挑战。本文系统评估了专有和开源的多模态大语言模型 (MLLM) 在 QaEgo4Dv2 数据集上的表现,该数据集是从 QaEgo4D 中派生并精炼的以身体姿态视频为导向的数据集。我们评估了四个流行的 MLLM(GPT-4o、Gemini-1.5-Pro、Video-LLaVa-7B 和 Qwen2-VL-7B-Instruct),使用零样本和微调方法分别针对 OpenQA 和 CloseQA 设置进行评估。我们引入 QaEgo4Dv2 以缓解 QaEgo4D 中的注释噪声,实现更可靠的比较。我们的结果显示,微调后的 Video-LLaVa-7B 和 Qwen2-VL-7B-Instruct 取得了新的最佳性能,分别在 OpenQA 方面提升了最高达 +2.6% 的 ROUGE/METEOR,在 CloseQA 方面提升了最高达 +13% 的准确率。我们还进行了详尽的错误分析,表明模型在空间推理和细粒度对象识别方面存在困难——这些是未来改进的关键领域。

关键词

引用

@article{arxiv.2504.04550,
  title  = {Advancing Egocentric Video Question Answering with Multimodal Large Language Models},
  author = {Alkesh Patel and Vibhav Chitalia and Yinfei Yang},
  journal= {arXiv preprint arXiv:2504.04550},
  year   = {2025}
}

备注

8 pages