理解短时教育娱乐视频的病毒式传播:基于评估准则的视觉语言模型框架
计算机视觉与模式识别
2025-12-29 v1
摘要
评估短时视频内容需要超越表面级质量指标,走向与人类一致的多模态推理。虽然已有诸如 VideoScore-2 等框架评估视觉与语义保真度,但未能捕捉特定音视频属性如何驱动真实观众参与度。在本工作中,我们提出一种数据驱动的评估框架,使用视觉语言模型(VLM)提取无监督音视频特征,将其聚类为可解释因子,并训练回归式评估器来预测短时教育娱乐视频的参与度。我们精选的 YouTube Shorts 数据集 enables 对 VLM 派生特征与人类参与行为之间的关系进行系统性分析。实验表明,预测参与度与实际参与度之间存在强相关性,说明我们的轻量级、基于特征的评估器在解释性和可扩展性方面优于传统指标(如 SSIM、FID)。通过以多模态特征重要性和以人类为中心的参与信号为基础,Our approach advances toward robust and explainable video understanding。
引用
@article{arxiv.2512.21402,
title = {Understanding Virality: A Rubric based Vision-Language Model Framework for Short-Form Edutainment Evaluation},
author = {Arnav Gupta and Gurekas Singh Sahney and Hardik Rathi and Abhishek Chandwani and Ishaan Gupta and Pratik Narang and Dhruv Kumar},
journal= {arXiv preprint arXiv:2512.21402},
year = {2025}
}
备注
Under Review