PreFM:基于预测性未来建模的在线视听事件解析
计算机视觉与模式识别
2025-10-24 v2
摘要
视听事件解析在理解多模态视频内容中起着至关重要的作用,但现有方法通常依赖于对整个视频进行具有庞大模型规模的离线处理,限制了其实时适用性。我们引入了在线视听事件解析 (On-AVEP),这是一种通过顺序分析输入视频流来解析音频、视觉及视听事件的新范式。On-AVEP 任务要求模型具备两项关键能力:(1) 精确的在线推理,以在在线环境中有效区分上下文不明确且有限的事件,以及 (2) 实时效率,以在高性能与计算约束之间取得平衡。为了培养这些能力,我们提出了预测性未来建模 (PreFM) 框架,其特点是:(a) 预测性多模态未来建模,用于推断并整合有益的未来视听线索,从而增强上下文理解;(b) 模态无关的稳健表示以及焦点时间优先级排序,以提高精度与泛化能力。在 UnAV-100 和 LLP 数据集上的大量实验表明,PreFM 以显著更少的参数大幅优于最先进的方法,为实时多模态视频理解提供了一种富有洞察力的方法。代码可在 https://github.com/XiaoYu-1123/PreFM 获取。
引用
@article{arxiv.2505.23155,
title = {PreFM: Online Audio-Visual Event Parsing via Predictive Future Modeling},
author = {Xiao Yu and Yan Fang and Xiaojie Jin and Yao Zhao and Yunchao Wei},
journal= {arXiv preprint arXiv:2505.23155},
year = {2025}
}
备注
This paper is accepted by 39th Conference on Neural Information Processing Systems (NeurIPS 2025)