中文

ViDAS:基于视觉的危险评估与评分

计算机视觉与模式识别 2025-03-03 v1

摘要

我们提出了一套新型数据集,以推动危险分析与评估,旨在解决如何量化视频内容中的危险程度以及大型语言模型(LLM)评估者在该领域的水平如何接近人类的挑战。通过收集包含各种事件的 100 个 YouTube 视频实现上述目标。每段视频都由人类参与者标注,他们以 0(对人类无危险)到 10(危及生命)的比例尺提供危险评级,并附上精确的时间戳指示危险升高的时刻。此外,我们利用 LLM 独立评估这些视频的危险水平,方法是使用视频摘要。我们引入均方误差(MSE)分数,用于多模态元评估人类和 LLM 危险评估之间的对齐程度。我们的数据集不仅为视频内容的危险评估提供了新的资源,也展示了 LLM 在实现类人评估方面的潜力。

关键词

引用

@article{arxiv.2410.00477,
  title  = {ViDAS: Vision-based Danger Assessment and Scoring},
  author = {Pranav Gupta and Advith Krishnan and Naman Nanda and Ananth Eswar and Deeksha Agarwal and Pratham Gohil and Pratyush Goel},
  journal= {arXiv preprint arXiv:2410.00477},
  year   = {2025}
}

备注

Preprint