关键步骤水平的人类技能生成器学习
计算机视觉与模式识别
2025-02-13 v1
摘要
我们致力于在关键步骤水平学习人类技能生成器。技能的生成是一项具有挑战性的任务,但其成功实施可能会极大促进人类技能学习,并为具身智能提供更多经验。尽管当前的视频生成模型可以合成简单且原子化的人类操作,但它们在处理人类技能方面存在困难,因为人类技能涉及多步骤、持续时间较长的动作和复杂的场景转换,因此,现有的朴素自回归方法无法合成长视频。为此,我们提出了一种新任务——关键步骤技能生成(Key-step Skill Generation, KS-Gen),旨在降低生成人类技能视频的复杂性。给定初始状态和技能描述,该任务是生成完成技能所需的关键步骤视频片段,而非完整视频。为支持该任务,我们引入了严格筛选的数据集,并定义了多个评估指标来衡量性能。鉴于 KS-Gen 的复杂性,我们提出了该任务的新框架。首先,多模态大语言模型(MLLM)通过检索机制生成关键步骤的描述。随后,我们使用关键步骤图像生成器(Key-step Image Generator, KIG)来解决关键步骤在技能视频中的不连续性。最后,视频生成模型利用这些描述和关键步骤图像来生成具有高时序一致性的关键步骤视频片段。我们对结果进行详细分析,希望为人类技能生成提供更多见解。所有模型和数据均可在 https://github.com/MCG-NJU/KS-Gen 获取。
引用
@article{arxiv.2502.08234,
title = {Learning Human Skill Generators at Key-Step Levels},
author = {Yilu Wu and Chenhui Zhu and Shuai Wang and Hanlin Wang and Jing Wang and Zhaoxiang Zhang and Limin Wang},
journal= {arXiv preprint arXiv:2502.08234},
year = {2025}
}