中文

通过智能体思维蒸馏提升视频-大语言模型的推理能力

计算机视觉与模式识别 2025-02-14 v2

摘要

本文针对视频问答(VideoQA)任务,旨在解决该任务常需多步推理和深入理解时空动态的问题。虽然大型视频语言模型在基准测试上表现良好,但常缺乏可解释性和时空 grounding。我们提出了智能体思维蒸馈(Agent-of-Thoughts Distillation, AoTD)方法,通过纳入自动生成的链式思维(Chain-of-Thoughts, CoTs)来增强模型。具体而言,我们利用智能体系统将复杂问题分解为子任务,并通过专门的视觉模型来解决,中间结果随后被视为推理链。我们还引入了基于大型语言模型(LLM)的验证机制,以确保生成CoTs的可靠性。大量实验表明,AoTD在多个选择题和开放式基准测试上均取得了显著的性能提升。

关键词

引用

@article{arxiv.2412.01694,
  title  = {Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation},
  author = {Yudi Shi and Shangzhe Di and Qirui Chen and Weidi Xie},
  journal= {arXiv preprint arXiv:2412.01694},
  year   = {2025}
}