UniEditBench:用于图像和视频编辑的统一且高性价比基准
计算机视觉与模式识别
2026-04-20 v1 人工智能
摘要
视觉编辑模型的评估在不同方法和模态之间仍然碎片化。现有基准常常针对特定范式设计,导致跨范式公平比较困难;而视频编辑缺乏可靠的评估基准。此外,常见的自动评估指标常与人类偏好错位,而直接部署大型多模态模型(MLLM)作为评估器则产生巨大的计算和经济成本。我们提出 UniEditBench,一个支持图像和视频编辑的统一基准,能够在共享协议下支持基于重构和指令驱动的方法。UniEditBench 包含九类图像操作(Add、Remove、Replace、Change、Stroke-based、Extract、Adjust、Count、Reorder)和八类视频操作,涵盖计数、空间重排序等具挑战性的组合任务。为实现可扩展评估,我们将高容量 MLLM 评判器(Qwen3-VL-235B-A22B Instruct)蒸馏为轻量级 4B/8B 评估器,提供结构忠实度、文本对齐、背景一致性、自然性及视频的时空一致性等多维度评分。实验表明,蒸馏后的评估器与人类判断高度一致,相较于教师模型显著降低部署成本。UniEditBench 提供了针对现代视觉编辑方法的实用且可复现的评估协议。我们的基准及关联奖励模型已公开发布于 https://github.com/wesar1/UniEditBench。
引用
@article{arxiv.2604.15871,
title = {UniEditBench: A Unified and Cost-Effective Benchmark for Image and Video Editing via Distilled MLLMs},
author = {Lifan Jiang and Tianrun Wu and Yuhang Pei and Chenyang Wang and Boxi Wu and Deng Cai},
journal= {arXiv preprint arXiv:2604.15871},
year = {2026}
}