GeneVA:用于生成文本到视频工件的人类注释数据集
计算机视觉与模式识别
2025-09-11 v1
摘要
近期概率生成模型的进展将能力范围从静态图像合成扩展到文本驱动视频生成。然而,其生成过程的内在随机性可能导致不可预测的工件,如不可能的物理和时序不一致。解决这一挑战需要系统性基准测试,然而现有数据集主要聚焦于生成图像,因视频具有独特时空复杂性而受限。为填补这一空白,我们介绍GeneVA——一个大规模视频生成工件数据集,包含丰富的人类注释,专注于来自自然文本提示生成视频中的时空工件。我们希望GeneVA能够促进并辅助关键应用,如基准模型性能评估和改进生成视频质量。
引用
@article{arxiv.2509.08818,
title = {GeneVA: A Dataset of Human Annotations for Generative Text to Video Artifacts},
author = {Jenna Kang and Maria Silva and Patsorn Sangkloy and Kenneth Chen and Niall Williams and Qi Sun},
journal= {arXiv preprint arXiv:2509.08818},
year = {2025}
}