VF-Eval:评估多模态大语言模型对 AIGC 视频的反馈生成能力
计算机视觉与模式识别
2025-05-30 v1 人工智能
计算与语言
摘要
最近,多模态大语言模型 (MLLM) 在视频问答方面得到了广泛研究。然而,大多数现有的评估集中于自然视频,忽略了合成视频,例如人工智能生成内容 (AIGC)。同时,视频生成方面的一些工作依赖 MLLM 来评估生成视频的质量,但 MLLM 在解读 AIGC 视频方面的能力在很大程度上仍未被探索。为了解决这一问题,我们提出了一个新基准 VF-Eval,它引入了四个任务——连贯性验证、错误感知、错误类型检测和推理评估——以全面评估 MLLM 在 AIGC 视频上的能力。我们在 VF-Eval 上评估了 13 个前沿 MLLM,发现即使是表现最好的模型 GPT-4.1,也难以在所有任务中持续取得良好表现。这突显了我们基准的挑战性。此外,为了研究 VF-Eval 在改进视频生成中的实际应用,我们进行了一项实验 RePrompt,证明使 MLLM 更紧密地与人类反馈对齐可以有益于视频生成。
引用
@article{arxiv.2505.23693,
title = {VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos},
author = {Tingyu Song and Tongyan Hu and Guo Gan and Yilun Zhao},
journal= {arXiv preprint arXiv:2505.23693},
year = {2025}
}
备注
ACL 2025 Main