中文

MG-Former:面向音乐驱动 3D 指挥手势生成的 Transformer 框架

声音 2026-05-05 v1 多媒体

摘要

从音乐生成具有表现力的指挥手势是一项具有挑战性的跨模态运动合成问题:输出必须遵循长期音乐结构,保持节拍级同步,并作为细粒度 3D 人体表演保持合理性。现有指挥运动研究常受限于稀疏姿态表示、小规模数据或不直接衡量音乐与手势相互对齐的评估协议。本文提出 TransConductor,一个基于 Transformer 的框架,用于音乐驱动指挥手势生成。我们引入 ConductorMotion,一个针对专业指挥手势的 SMPL 参数数据构建管道,从指挥视频中恢复详细身体动作并构建数据集。给定从音频中提取的声学描述符和初始姿态,TransConductor 使用 Trans-Temporal Music Encoder 和 Trans-Temporal Conducting Gesture Decoder 自动生成预测 SMPL 姿态参数。为更好评估艺术对应性,我们构建了一个基于检索的评估模型,将音乐和手势嵌入共享空间,生成 FID、模态距离、多模态距离和多样性指标。实验表明,TransConductor 在舞蹈生成和指挥生成基准中超越现有方法,而消融实验验证了 Transformer 架构和所提对齐损失的优势。

关键词

引用

@article{arxiv.2605.01197,
  title  = {MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation},
  author = {Ke Qiu and Yawen Qin and Tianzhi Jia and Xiaole Yang and Kaimin Wang and Kaixing Yang},
  journal= {arXiv preprint arXiv:2605.01197},
  year   = {2026}
}