能数到九吗?现代文本到视频模型计数限制的人类评估基准
计算机视觉与模式识别
2025-04-08 v1 人工智能
机器学习
摘要
生成模型推动了 AI 任务在各方面的显著进展,包括文本到视频生成。Video LDM 和 Stable Video Diffusion 等模型能够从文本指令生成逼真的电影级别视频。尽管已取得这些进展,当前文本到视频模型仍面临可靠遵循人类指令的根本挑战,尤其是遵循简单数值约束。本文提出 T2VCountBench(Text-to-Video Counting Benchmark),旨在评估 2025 年 SOTA(State-of-the-Art)文本到视频模型的计数能力。该基准采用严格的人类评估来衡量生成物体的数量,涵盖开源和商业模型等多样化的生成器。大量实验揭示,所有现有模型在处理基础数值任务时均难以克服,几乎总是无法生成物体数量为 9 或更少的视频。此外,我们的全面消化研究探讨了视频风格、时间动态和多语言输入等因素对计数性能的影响。我们还探索了提示词优化技术,表明将任务分解为更小的子任务并不容易缓解这些限制。我们的发现凸显了当前文本到视频生成中的重要挑战,并为未来研究提供了改进对基础数值约束遵循能力的见解。
引用
@article{arxiv.2504.04051,
title = {Can You Count to Nine? A Human Evaluation Benchmark for Counting Limits in Modern Text-to-Video Models},
author = {Xuyang Guo and Zekai Huang and Jiayan Huo and Yingyu Liang and Zhenmei Shi and Zhao Song and Jiahao Zhang},
journal= {arXiv preprint arXiv:2504.04051},
year = {2025}
}