中文

VideoForest:基于人的锚定的层次化推理用于跨视频问答

计算机视觉与模式识别 2025-08-06 v1 多媒体

摘要

跨视频问答在建立视频流之间有意义的联系和管理多源信息检索方面,面临着显著挑战,尤其是超越传统单视频理解的范畴。我们引入VideoForest,这是一个新型框架,通过人的锚定层次化推理来解决这些挑战。我们的方法将人类特征作为视频之间自然桥梁点,实现了无需端到端训练的有效跨视频理解。VideoForest集成了三个关键创新:1)一种人类锚定特征提取机制,采用ReID和跟踪算法在多个视频源之间建立稳健的时空关系;2)一种多粒度跨树结构,围绕人物级别轨迹对视觉内容进行层次化组织;3)一种多智能体推理框架,高效地遍历该层次结构以回答复杂的跨视频查询。为评估我们的方法,我们开发了CrossVideoQA,这是一个为人类中心的跨视频分析专门设计的全面基准数据集。实验结果表明,VideoForest在跨视频推理任务中表现优异,在人物识别、行为分析和总结推理中分别实现了71.93%、83.75%和51.67%的准确率,显著优于现有方法。我们的工作通过人类级别特征统一了多个视频流,实现了分布式视觉信息的高级推理,同时保持了计算效率,为跨视频理解开辟了新的范式。

关键词

引用

@article{arxiv.2508.03039,
  title  = {VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering},
  author = {Yiran Meng and Junhong Ye and Wei Zhou and Guanghui Yue and Xudong Mao and Ruomei Wang and Baoquan Zhao},
  journal= {arXiv preprint arXiv:2508.03039},
  year   = {2025}
}