HiMu: 用于长视频问答的分层多模态帧选择
计算机视觉与模式识别
2026-03-20 v1 人工智能
摘要
长视频问答需要对扩展的时间上下文进行推理,这使得帧选择对于受限于有限上下文窗口的大型视觉语言模型 (LVLM) 至关重要。现有方法面临一个尖锐的权衡:基于相似度的选择器速度快,但会将组合查询坍缩为单个稠密向量,丢失子事件排序和跨模态绑定;基于智能体的方法通过迭代 LVLM 推理恢复了这种结构,但代价高昂。我们引入了 HiMu,一个弥合这一差距的无训练框架。单次纯文本 LLM 调用将查询分解为一个分层逻辑树,其叶子节点是原子谓词,每个谓词被路由到一个轻量级专家,涵盖视觉 (CLIP、开放词汇检测、OCR) 和音频 (ASR、CLAP)。得到的信号被归一化、时间平滑以对齐不同模态,并通过模糊逻辑算子自底向上组合,这些算子强制执行时间顺序和邻接关系,产生一个连续的满意度曲线。在 Video-MME、LongVideoBench 和 HERBench-Lite 上的评估表明,HiMu 推进了效率-准确率的帕累托前沿:在 16 帧下使用 Qwen3-VL 8B,它优于所有竞争的选择器,并且使用 GPT-4o,它超越了在 32-512 帧下运行的智能体系统,同时所需的 FLOPs 大约少 10 倍。
引用
@article{arxiv.2603.18558,
title = {HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering},
author = {Dan Ben-Ami and Gabriele Serussi and Kobi Cohen and Chaim Baskin},
journal= {arXiv preprint arXiv:2603.18558},
year = {2026}
}