GAIA:重新思考AI生成视频的动作质量评估
计算机视觉与模式识别
2024-10-15 v2
摘要
评估动作质量对于确保AI生成视频的质量至关重要且具有挑战性,这进一步受制于AI生成视频(AIGV)中动作本质含糊的特性。当前的动作质量评估(AQA)算法主要关注来自真实特定情景的动作,并借助规范动作特征进行预训练,因而在AIGV中无法适用。为解决这些问题,我们从一种新颖的因果推理视角出发,进行大规模主观评估,构建GAIA(Generic AI-generated Action dataset),结果产生了971,244条关于9,180个视频-动作对的评级。基于GAIA,我们评估了流行的文本到视频(T2V)模型在生成视觉合理动作方面的能力,揭示了其在不同类别动作上的优势与不足。我们还将GAIA扩展为测试基准,以评估现有自动评估方法的AQA能力。结果表明,传统AQA方法、最近T2V基准中的动作相关指标以及主流视频质量方法在AIGV中的平均SRCC分别为0.454、0.191和0.519,表明当前模型与人类动作感知模式之间存在显著的鸿沟。我们的发现凸显了动作质量作为研究AIGV的独特视角的重要性,并可催化发展具备增强AQA能力的方法。
引用
@article{arxiv.2406.06087,
title = {GAIA: Rethinking Action Quality Assessment for AI-Generated Videos},
author = {Zijian Chen and Wei Sun and Yuan Tian and Jun Jia and Zicheng Zhang and Jiarui Wang and Ru Huang and Xiongkuo Min and Guangtao Zhai and Wenjun Zhang},
journal= {arXiv preprint arXiv:2406.06087},
year = {2024}
}
备注
Accepted by NeurIPS2024 Dataset and Benchmark Track as Spotlight. 33 pages, 15 figures