WebVR:基于人类对齐视觉评语标准的人类类多模态LLM视频网页重建基准
计算机视觉与模式识别
2026-03-17 v1
摘要
现有网页生成基准依赖文本提示或静态屏幕截图作为输入。然而,视频自然传递更丰富的信号,如交互流程、转换时机和运动连续性,这些都是忠实网页重建所必需的。尽管存在这种潜力,视频条件下的网页生成仍鲜有探索,且缺乏针对此任务的专门基准。为填补这一空白,本文引入WebVR,一个评估MLLMs是否能忠实重建演示视频中网页的基准。WebVR包含175个跨越多种类别的网页,所有网页均通过受控合成管道构建,确保具有多样且真实的演示,且与现有在线页面无交叉。我们还设计了细粒度的人类对齐视觉评语,在多个维度上评估生成的网页。实验在19个模型上进行,结果显示在细化风格和运动质量方面存在显著差距,而基于评语的自动评估与人类偏好达96%的一致性。我们发布数据集、评估工具包以及基线结果,以支持未来视频到网页生成的研究。
引用
@article{arxiv.2603.13391,
title = {WebVR: Benchmarking Multimodal LLMs for WebPage Recreation from Videos via Human-Aligned Visual Rubrics},
author = {Yuhong Dai and Yanlin Lai and Mitt Huang and Hangyu Guo and Dingming Li and Hongbo Peng and Haodong Li and Yingxiu Zhao and Haoran Lyu and Zheng Ge and Xiangyu Zhang and Daxin Jiang},
journal= {arXiv preprint arXiv:2603.13391},
year = {2026}
}