中文

优化多模态大语言模型用于第一人称视频理解:HD-EPIC VQA挑战赛的解决方案

计算机视觉与模式识别 2026-01-16 v1 多媒体 图像与视频处理

摘要

多模态大语言模型(MLLMs)在处理诸如HD-EPIC VQA等复杂视频问答基准测试时,由于查询/选项模糊、长程时间推理能力差以及输出格式不规范而表现不佳。我们提出了一个集成框架,包括查询/选项预处理、特定领域的Qwen2.5-VL微调、一种新颖的用于多步推理的时间链式思维(T-CoT)提示,以及稳健的后处理。该系统在HD-EPIC VQA上达到了41.6%的准确率,凸显了在要求严苛的视频理解任务中进行整体流程优化的必要性。我们的代码和微调模型可在 https://github.com/YoungSeng/Egocentric-Co-Pilot 获取。

关键词

引用

@article{arxiv.2601.10228,
  title  = {Optimizing Multimodal LLMs for Egocentric Video Understanding: A Solution for the HD-EPIC VQA Challenge},
  author = {Sicheng Yang and Yukai Huang and Shitong Sun and Weitong Cai and Jiankang Deng and Jifei Song and Zhensong Zhang},
  journal= {arXiv preprint arXiv:2601.10228},
  year   = {2026}
}

备注

4 pages, 1 figure, CVPR 2025 EgoVis Workshop, 2nd Place in HD-EPIC Challenge