中文

VEFX-Bench:用于通用视频编辑和视觉特效的全面基准

计算机视觉与模式识别 2026-04-21 v2 人工智能 计算与语言

摘要

随着AI辅助视频创建变得越来越实用,指令导导的视频编辑对于精炼生成或捕获的片段以满足专业要求至关重要。然而,该领域仍缺乏规模大且拥有完整编辑示例的人工标注数据集,以及用于比较编辑系统的标准化评估器。现有资源受限于规模小、缺少编辑输出或缺乏人类质量标签,而当前的评估常常依赖昂贵的手动检查或不专为编辑质量设计的通用视觉-语言模型判官。我们引入VEFX-Dataset,包含5049个视频编辑示例,覆盖9个主要编辑类别和32个子类别,每个示例在三个解耦维度上进行标签:指令遵循、渲染质量和编辑独特性。基于VEFX-Dataset,我们提出VEFX-Reward,一个专为视频编辑质量评估设计的奖励模型。VEFX-Reward同时处理源视频、编辑指令和编辑后视频,通过序数回归预测各维度的质量分数。我们进一步发布VEFX-Bench,包含300个精选视频-提示对,用于标准化比较编辑系统。实验表明,VEFX-Reward在标准IQA/VQA指标和组间偏好评估中,与人类判断的一致性更强于通用VLM判官和先前奖励模型。使用VEFX-Reward作为评估器,我们对代表性商业和开源视频编辑系统进行基准测试,揭示了当前模型在视觉可信度、指令遵循和编辑局部性之间存在持久的差距。我们的项目页面为https://xiangbogaobarry.github.io/VEFX-Bench/。

关键词

引用

@article{arxiv.2604.16272,
  title  = {VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects},
  author = {Xiangbo Gao and Sicong Jiang and Bangya Liu and Xinghao Chen and Minglai Yang and Siyuan Yang and Mingyang Wu and Jiongze Yu and Qi Zheng and Haozhi Wang and Jiayi Zhang and Jie Yang and Zihan Wang and Qing Yin and Zhengzhong Tu},
  journal= {arXiv preprint arXiv:2604.16272},
  year   = {2026}
}