MAGNET:基于多智能体框架寻找音视频针针——通过对多视频haystack进行推理
计算机视觉与模式识别
2025-06-17 v2 人工智能
摘要
大型多模态模型(LMM)在音视频理解方面取得了显著进展,但在需要跨越广泛视频集合进行复杂推理的真实场景中仍感到困境。现有视频问答基准的范围有限,通常仅涉及一个片段的查询,这不足以代表实际应用中大规模音视频检索和推理的挑战。为填补这一差距,我们提出一种新任务,称为AV-HaystacksQA,即识别针对查询在不同视频中识别 salient 段落并将其链接起来以生成最具信息性的答案。为此,我们提出AVHaystacks基准,包含3100个标注的QA对,用于评估LMM在多视频检索和时间定位任务中的能力。此外,我们提出一种模型无关的、基于多智能体的框架MAGNET来应对这一挑战,在我们提出的AVHaystacks上的QA任务中实现了对BLEU@4和GPT评估分数的最高89%和65%相对改进。为实现最佳响应生成的多视频检索和时间定位的稳健评估,我们引入两种新指标:STEM,捕捉地面实况与预测步骤序列之间的对齐错误;MTGS,用于促进分段级别定位性能的平衡和可解释评估。项目:https://schowdhury671.github.io/magnet_project/
引用
@article{arxiv.2506.07016,
title = {MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks},
author = {Sanjoy Chowdhury and Mohamed Elmoghany and Yohan Abeysinghe and Junjie Fei and Sayan Nag and Salman Khan and Mohamed Elhoseiny and Dinesh Manocha},
journal= {arXiv preprint arXiv:2506.07016},
year = {2025}
}
备注
Audio-visual learning, Audio-Visual RAG, Multi-Video Linkage