TDVE-Assessor:基于大型多模态模型的文本驱动视频编辑质量基准与评估
计算机视觉与模式识别
2025-05-27 v1
摘要
文本驱动视频编辑正在快速发展,然而由于缺乏能够辨别编辑质量细微差别的专用视频质量评估(VQA)模型,其严格评估仍具挑战性。为了填补这一关键空白,我们引入了 TDVE-DB,一个用于文本驱动视频编辑的大规模基准数据集。TDVE-DB 包含由 12 个不同模型在 8 个编辑类别中生成的 3,857 个编辑视频,并沿三个关键维度(即编辑视频质量、编辑对齐和结构一致性)标注了 173,565 个人类主观评分。基于 TDVE-DB,我们首先对 12 个最先进的编辑模型进行了全面评估,揭示了当前视频技术的优缺点,然后在文本驱动视频编辑评估的背景下对现有的 VQA 方法进行了基准测试。基于这些见解,我们提出了 TDVE-Assessor,一个专门为文本驱动视频编辑评估设计的新型 VQA 模型。TDVE-Assessor 将空间和时间视频特征集成到大型语言模型(LLM)中,以实现丰富的上下文理解,从而提供全面的质量评估。大量实验表明,TDVE-Assessor 在 TDVE-DB 上的所有三个评估维度上均显著优于现有的 VQA 模型,达到了新的最先进水平。TDVE-DB 和 TDVE-Assessor 将在发表后发布。
引用
@article{arxiv.2505.19535,
title = {TDVE-Assessor: Benchmarking and Evaluating the Quality of Text-Driven Video Editing with LMMs},
author = {Juntong Wang and Jiarui Wang and Huiyu Duan and Guangtao Zhai and Xiongkuo Min},
journal= {arXiv preprint arXiv:2505.19535},
year = {2025}
}
备注
25 pages, 14 figures, 8 tables