中文

VSD2M:大规模视觉语言贴纸数据集用于多帧动画贴纸生成

人机交互 2025-03-27 v2

摘要

作为社交媒体中常见的交流形式,贴纸因其能够生动、可爱且有趣地传递情感而深受用户喜爱。用户倾向于通过检索来获取合适的贴纸,而非创建贴纸,因为创建贴纸耗时且依赖于基于规则的创意工具, capabilities 有限。目前,先进的文本到视频算法已催生了大量通用视频生成系统,允许用户仅通过提供简单文本提示即可定制高质量、照片般真实的视频。然而,创建定制化的动画贴纸(其帧率较低且抽象语义更强)受到数据获取困难和基准不完整的限制。为促进研究人员在动画贴纸生成(ASG)领域的探索,我们首先构建了目前规模最大的视觉语言贴纸数据集,命名为 VSD2M,规模达两百万,包含静态和动画贴纸。其次,为了提高传统视频生成方法在ASG任务中离散特征的性能,我们提出了一种时空交互(STI)层,利用语义交互和细节保留来解决信息利用不足的问题。此外,我们在VSD2M上训练了若干视频生成方法(如基于转换器和扩散的方法)的基线模型,并进行了详细分析,以在ASG任务中建立系统性的监督。到目前为止,这是最全面的大规模基准,用于多帧动画贴纸生成,我们希望这项工作能为其他学者在智能创作领域提供有价值的灵感。

关键词

引用

@article{arxiv.2412.08259,
  title  = {VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation},
  author = {Zhiqiang Yuan and Jiapei Zhang and Ying Deng and Yeshuang Zhu and Jie Zhou and Jinchao Zhang},
  journal= {arXiv preprint arXiv:2412.08259},
  year   = {2025}
}