Tiger200K:来自 UGC 平台的人工精选高视觉质量视频数据集
计算机视觉与模式识别
2025-04-22 v1
摘要
近期开源文本到视频生成模型的涌现显著激活了研究社区,但其依赖专有训练数据集仍是关键约束。虽然现有开放数据集如 Koala-36M 采用算法筛选早期平台抓取的视频,但仍缺乏针对高级视频生成模型微调所需的质量。我们提出了 Tiger200K,一个来自用户生成内容 (UGC) 平台的人工精选高视觉质量视频数据集。通过优先考虑视觉保真度和审美质量,Tiger200K 强调了人类专业知识在数据精选中的关键作用,并通过包括 shot boundary 检测、OCR、边缘检测、运动过滤和精细双语描述等简单有效的管道,为微调和优化视频生成架构提供高质量、时序一致的视频文本对。该数据集将持续扩展,并作为开源计划发布,以推动视频生成模型的研究和应用。项目页面:https://tinytigerpan.github.io/tiger200k/
引用
@article{arxiv.2504.15182,
title = {Tiger200K: Manually Curated High Visual Quality Video Dataset from UGC Platform},
author = {Xianpan Zhou},
journal= {arXiv preprint arXiv:2504.15182},
year = {2025}
}
备注
Project page: https://tinytigerpan.github.io/tiger200k/