中文

POVQA:基于偏好优化的视频问答,带有解释提升数据效率

计算机视觉与模式识别 2026-04-01 v3 多媒体

摘要

长视频多模态问答需要对视觉证据和对话进行结构化推理,但大型视觉语言模型(LVLMs)受限于上下文窗口和计算资源。我们提出了 POVQA,将每个秒压缩为时间池化图像(1 fps 池化图像),在固定 token 预算下保持密集的时间覆盖。我们对 Qwen2.5-VL-7B 进行监督微调(SFT),可选地对偏好进行 DPO 优化。我们引入 ReasonVQA 作为一个小规模诊断数据集,包含 12 部电影和 239 组人工标注的 QA+解释三元组,用于在压缩情形下对长上下文多模态推理进行受控分析。在 ReasonVQA 上,SFT 将最佳的仅池化基线从 0.212 提升至 0.550 F1,表明池化证据加解释监督在此情境下提供了主要性能提升。在零样本迁移中,POVQA 也在 SFT+DPO 后达到 64.7% 的 TVQA 正确率。这些结果仍是初步的:ReasonVQA 较小,池化可能会丢失细粒度的时间顺序,DPO 的效果在不同情境下并非一致积极。代码、数据集和额外的定性评估均可用于 \href{https://povqa.github.io}{https://povqa.github.io}。

关键词

引用

@article{arxiv.2510.01009,
  title  = {POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency},
  author = {Ashim Dahal and Ankit Ghimire and Saydul Akbar Murad and Nick Rahimi},
  journal= {arXiv preprint arXiv:2510.01009},
  year   = {2026}
}

备注

Accepted in MAR at CVPR Workshop (Proceedings Track)