中文

VE-Bench:面向文本驱动视频编辑质量评估的主观对齐基准套件

计算机视觉与模式识别 2024-12-19 v2

摘要

文本驱动视频编辑近期经历了快速的发展。尽管如此,编辑后视频的评估仍是一个相当大的挑战。当前的评估指标倾向于无法与人类感知保持一致,对于视频编辑有效的定性指标仍显著缺失。为此,我们引入 VE-Bench,一个专为评估文本驱动视频编辑而设计的基准套件。该套件包括 VE-Bench DB,即视频编辑(video editing)视频质量评估(VQA)数据库。VE-Bench DB 包含多样化的源视频,涵盖各种运动和主题,以及多种不同的编辑提示、来自 8 个不同模型的编辑结果,以及来自 24 位人类标注员的平均意见分数(Mean Opinion Scores, MOS)。基于 VE-Bench DB,我们进一步提出 VE-Bench QA,即用于文本驱动视频编辑任务的定量人类对齐度量方法。除了传统 VQA 方法所强调的审美、失真及其他视觉质量指标外,VE-Bench QA 还专注于文本-视频对齐以及源视频与编辑后视频之间的相关性建模。它提出了一种新的视频编辑评估网络,在与人类偏好高度一致方面取得优异性能。鉴于目前尚无人了解,VE-Bench 引入了视频编辑领域的第一个质量评估数据集,以及一个有效的主观对齐定量指标。所有数据和代码将公开于 https://github.com/littlespray/VE-Bench。

关键词

引用

@article{arxiv.2408.11481,
  title  = {VE-Bench: Subjective-Aligned Benchmark Suite for Text-Driven Video Editing Quality Assessment},
  author = {Shangkun Sun and Xiaoyu Liang and Songlin Fan and Wenxu Gao and Wei Gao},
  journal= {arXiv preprint arXiv:2408.11481},
  year   = {2024}
}

备注

Accepted to AAAI 2025