StreamReady:在长序列流动视频中学习何时作答
计算机视觉与模式识别
2026-03-10 v1
摘要
流式视频理解通常涉及时间敏感的场景,模型需要在支持证据出现的时刻准确作答:在证据呈现之前作答会导致猜测,在证据消散后作答则会降低实时性效用。为捕捉这一行为,我们提出了基于答案准备得分(Answer Readiness Score, ARS)的流式视频理解的准备度感知表述,ARS 是一种具有非对称早期和迟延惩罚的时机感知目标。当 ARS 与正确性相结合时,ARS 定义了一种有效准确度,其不仅衡量模型是否正确,还衡量模型是否在恰当时机作答。基于此表述,我们引入 StreamReady 框架,通过一种轻量级的准备机制统一时序推理与准时作答,该机制在作答前决定是否已观察到足够的证据。为评估这一能力,我们进一步引入 ProReady-QA 数据集,包含标注好的答案证据窗口以及涵盖局部和全局语境的主动多轮问题。StreamReady 在 ProReady-QA 上取得优异性能,在八个额外的流式和离线长视频基准上持续领先于先前方法,展示了其稳健且广泛可迁移的视频理解能力。
引用
@article{arxiv.2603.08620,
title = {StreamReady: Learning What to Answer and When in Long Streaming Videos},
author = {Shehreen Azad and Vibhav Vineet and Yogesh Singh Rawat},
journal= {arXiv preprint arXiv:2603.08620},
year = {2026}
}
备注
Accepted in CVPR 2026