FingER:基于内容感知的 AI 生成视频细粒度评估与推理
计算机视觉与模式识别
2025-04-15 v1 人工智能
摘要
近期的视频生成技术进步给 AI 内容评估提出了巨大挑战,尤其是随着日益精细的模型的涌现。这种类视频中观察到的各种不一致和缺陷本质上都很复杂,使整体评分难以处理。在本文中,我们强调将细粒度推理集成到视频评估中的重要性,提出了一种名为 ing 的新型实体级推理评估框架,该框架首先自动生成 ine-grained ntity-level questions,然后通过 easoning model 对这些问题进行回答并给出分数,进而加权求和得到不同应用场景的总体分数。具体而言,我们利用 LLM 从五个不同角度推导实体级问题,这些问题(i)常常聚焦于内容的特定实体,从而通过 MLLM 更容易回答或评分,且(ii)更具可解释性。然后我们构建了一个 FingER 数据集,包含约 3300 个视频及其对应的 6 万条细粒度问答标注,每条标注都包含详细的推理依据。基于此,我们进一步探讨了各种训练方案,以最佳方式激励 MLLM 具备正确预测答案的推理能力。大量实验表明,使用冷启动策略通过群体相对策略优化(GRPO)训练的推理模型性能最佳。值得注意的是,我们的模型在 GenAI-Bench 上以 11.8% 的相对提升,在MonetBench 上以 5.5% 的相对提升获得最佳成绩,而这仅使用了 3300 条训练视频,最多是其他方法所用的训练样本的一个十分之一。我们的代码和数据集将很快公开。
引用
@article{arxiv.2504.10358,
title = {FingER: Content Aware Fine-grained Evaluation with Reasoning for AI-Generated Videos},
author = {Rui Chen and Lei Sun and Jing Tang and Geng Li and Xiangxiang Chu},
journal= {arXiv preprint arXiv:2504.10358},
year = {2025}
}
备注
10 pages, 4 figures