你在做什么?对可控人类视频生成的深入探讨
计算机视觉与模式识别
2025-03-07 v1
摘要
高质量的基准数据集是推动机器学习研究进步的关键。然而,尽管对视频生成的兴趣不断增长,但目前尚无全面的数据集来评估人类生成的可控性。人类可以执行各种动作和互动,但现有的像TikTok和TED演讲这类数据集缺乏足够的多样性和复杂性,无法完全捕捉视频生成模型的能力。我们通过引入'你在做什么?'(What Are You Doing?, WYD)来弥合这一差距,这是一个用于评估人类图像到视频生成可控性的新型基准数据集。WYD包含1,544个带有描述性字幕的视频,经过严格收集和标注,包含56个细粒度类别。这使我们能够系统性地衡量人类生成在9个方面(包括动作、互动和运动)的性能。我们还提出并验证了利用这些标注开发的自动评估指标,更能捕捉人类评估的特征。凭借我们的数据集和评估指标,我们对七个最先进的可控图像到视频生成模型进行了深入分析,展示了WYD如何为这些模型的能力提供新的洞见。我们发布了数据和代码以推动人类视频生成建模的进一步进步,地址为 https://github.com/google-deepmind/wyd-benchmark。
引用
@article{arxiv.2503.04666,
title = {What Are You Doing? A Closer Look at Controllable Human Video Generation},
author = {Emanuele Bugliarello and Anurag Arnab and Roni Paiss and Pieter-Jan Kindermans and Cordelia Schmid},
journal= {arXiv preprint arXiv:2503.04666},
year = {2025}
}