TMD-Bench:面向音乐-舞蹈联合生成的多层次评估范式
声音
2026-05-05 v1 人工智能
摘要
统一的音频-视频生成正快速获得产业和创作层面的应用,使虚拟制作和交互媒体等应用成为可能。然而,当从通用音频-视频合成转向音乐-舞蹈联合生成时,任务变得更加困难:必须在细粒度时间分辨率下,使音乐节奏、旋律和强调等驱动编舞动作,而这种节奏耦合并未被当前评估实践中使用的单模态指标或通用音视频一致性分数所捕获。我们引入 TMD-Bench,这是一个用于文本驱动音乐-舞蹈联合生成的基准测试,跨越单模态生成质量、指令遵循度和跨模态节奏对齐三个维度进行评估。该基准测试将可计算的物理指标与感知的多模态判断相结合,并得到一个精心挑选的节奏对齐音乐-舞蹈数据集和用于结构化音乐语义的细粒度 Music Captioner 的支持。TMD-Bench 进一步揭示了:(i) 现代商业音频-视频模型,如 Veo 3 和 Sora 2,产生高质量的音乐和视频,但节奏耦合优化不够一致,仍有改进空间;(ii) 我们基于节奏对齐数据的统一基线模型 RhyJAM 在保持竞争的单模态保真度的同时,实现了具竞争力的拍子级同步。这为构建显式优化节奏和动力学一致性的下一代音乐-舞蹈模型提供了前景。
引用
@article{arxiv.2605.01809,
title = {TMD-Bench: A Multi-Level Evaluation Paradigm for Music-Dance Co-Generation},
author = {Xiaoda Yang and Majun Zhang and Changhao Pan and Nick Huang and Yang Yuguang and Fan Zhuo and Pengfei Zhou and Jin Zhou and Sizhe Shan and Shan Yang and Miles Yang and Yang You and Zhou Zhao},
journal= {arXiv preprint arXiv:2605.01809},
year = {2026}
}