HOIGen-1M:用于人体-物体交互视频生成的大规模数据集
计算机视觉与模式识别
2025-04-01 v1
摘要
文本到视频(T2V)生成在根据文本生成复杂场景方面取得了显著进展。然而,由于缺乏标注准确的人体-物体交互(HOI)视频的大规模数据集,当前T2V模型常无法精确生成人体-物体交互。为此,我们引入HOIGen-1M,这是第一个用于HOI生成的大规模数据集,包含来自多样来源的超过一百万个高质量视频。具体而言,为保证视频的高质量,我们首先设计了一个高效框架,通过强大的多模态大语言模型(MLLM)自动筛选HOI视频,然后由人工标注员进一步清理视频。此外,为获得HOI视频的准确文本描述,我们设计了一种基于混合多模态专家(MoME)策略的新型视频描述方法,该方法不仅生成富有表现力的描述,还通过消除单个MLLM的幻觉现象。 Furthermore,由于缺乏用于评估生成HOI视频的评估框架,我们提出了两种以粗到细方式评估生成视频质量的新指标。大量实验表明,当前T2V模型在生成高质量HOI视频方面存在挑战,确认了HOIGen-1M数据集在改进HOI视频生成方面至关重要。项目网页可访问于https://liuqi-creat.github.io/HOIGen.github.io。
引用
@article{arxiv.2503.23715,
title = {HOIGen-1M: A Large-scale Dataset for Human-Object Interaction Video Generation},
author = {Kun Liu and Qi Liu and Xinchen Liu and Jie Li and Yongdong Zhang and Jiebo Luo and Xiaodong He and Wu Liu},
journal= {arXiv preprint arXiv:2503.23715},
year = {2025}
}
备注
CVPR 2025