基于 Transformer 的单次动作补全
计算机视觉与模式识别
2021-03-02 v1 图形学
摘要
动作补全是一个具有挑战性且被长期讨论的问题,在影视和游戏应用中具有重要意义。针对不同的动作补全场景(中间插值、内部填充与混合),以往大多数方法通过分情况设计来处理补全问题。本文提出一种简洁而有效的方法,在统一框架下解决多种动作补全问题,并在多种评估设定下取得了新的 SOTA 精度。受近期基于注意力模型巨大成功的启发,我们将补全视为序列到序列的预测问题。我们的方法由两个模块组成——一个带有自注意力的标准 Transformer 编码器,用于学习输入动作的长程依赖;以及一个可训练的混合嵌入模块,用于建模时间信息并区分关键帧。我们的方法能以非自回归方式运行,并在单次前向传播中实时预测多个缺失帧。最后我们展示了该方法在音乐-舞蹈应用中的有效性。
引用
@article{arxiv.2103.00776,
title = {Single-Shot Motion Completion with Transformer},
author = {Yinglin Duan and Tianyang Shi and Zhengxia Zou and Yenan Lin and Zhehui Qian and Bohan Zhang and Yi Yuan},
journal= {arXiv preprint arXiv:2103.00776},
year = {2021}
}
备注
10 pages, 6 figures. Project page: https://github.com/FuxiCV/SSMCT