FlexiAct:面向异构场景的灵活动作控制
计算机视觉与模式识别
2025-05-07 v1 人工智能
多媒体
摘要
动作定制涉及生成视频,其中主体执行由输入控制信号指定的动作。当前的方法使用姿态引导或全局运动定制,但受到空间结构(如布局、骨架和视点一致性)严格约束的限制,降低了在不同主体和场景间的适应性。为了克服这些限制,我们提出了FlexiAct,它将动作从参考视频迁移到任意目标图像。与现有方法不同,FlexiAct允许参考视频主体与目标图像之间在布局、视点和骨架结构上存在差异,同时保持身份一致性。实现这一点需要精确的动作控制、空间结构适应和一致性保持。为此,我们引入了RefAdapter,这是一个轻量级的图像条件适配器,在空间适应和一致性保持方面表现出色,在平衡外观一致性和结构灵活性方面超越了现有方法。此外,根据我们的观察,去噪过程在不同时间步对运动(低频)和外观细节(高频)表现出不同程度的关注。因此,我们提出了FAE(频率感知动作提取),与依赖分离时空架构的现有方法不同,它直接在去噪过程中实现动作提取。实验表明,我们的方法有效地将动作迁移到具有不同布局、骨架和视点的主体上。我们发布了代码和模型权重以支持进一步研究,地址为https://shiyi-zh0408.github.io/projectpages/FlexiAct/。
引用
@article{arxiv.2505.03730,
title = {FlexiAct: Towards Flexible Action Control in Heterogeneous Scenarios},
author = {Shiyi Zhang and Junhao Zhuang and Zhaoyang Zhang and Ying Shan and Yansong Tang},
journal= {arXiv preprint arXiv:2505.03730},
year = {2025}
}
备注
Accepted by Siggraph2025, Project Page: https://shiyi-zh0408.github.io/projectpages/FlexiAct/