RiskCueBench:基于早期风险线索的视频-语言模型预测推理基准
计算机视觉与模式识别
2026-01-22 v2 计算与语言
摘要
随着以视频为中心的社交媒体的快速发展,从视觉数据中预测风险事件的能力正在成为确保公共安全和防止实际意外事故的有前景的方向。先前的工作在驾驶、抗议和自然灾害等多个领域广泛研究了监督式视频风险评估。然而,许多现有数据集为模型提供了对完整视频序列的访问,包括事故本身,这显著降低了任务的难度。为更好地反映现实世界条件,我们引入了一个新的视频理解基准测试 RiskCueBench,在该基准测试中,视频被仔细标注以识别风险信号剪辑,即指示潜在安全关注的最早时刻。实验结果揭示了当前系统在解释演化情况和从早期视觉信号预测未来风险事件方面的显著差距,这突显了在实际应用中部署视频风险预测模型面临的重要挑战。
引用
@article{arxiv.2601.03369,
title = {RiskCueBench: Benchmarking Anticipatory Reasoning from Early Risk Cues in Video-Language Models},
author = {Sha Luo and Yogesh Prabhu and Timothy Ossowski and Kaiping Chen and Junjie Hu},
journal= {arXiv preprint arXiv:2601.03369},
year = {2026}
}
备注
*updated author email in this version