中文

面向视频到钢琴音乐生成的 Chain-of-Perform 支持基准

声音 2025-05-27 v1 计算机视觉与模式识别 音频与语音处理

摘要

从视频生成高质量钢琴音频需要视觉线索与音乐输出之间的精确同步,以确保准确的语义和时间对齐。然而,现有的评估数据集未能完全捕捉钢琴音乐生成所需的复杂同步。一个全面的基准测试至关重要,主要原因有二:(1) 现有指标无法反映视频到钢琴音乐交互的复杂性,以及 (2) 专门的基准数据集可以提供有价值的见解,以加速高质量钢琴音乐生成的进展。为了应对这些挑战,我们引入了 CoP 基准数据集——一个专门为视频引导的钢琴音乐生成设计的完全开源多模态基准。所提出的 Chain-of-Perform(CoP)基准提供了几个引人注目的特性:(1) 详细的多模态标注,通过逐步的 Chain-of-Perform 指导实现视频内容与钢琴音频之间精确的语义和时间对齐;(2) 一个通用的评估框架,用于严格评估通用和专用视频到钢琴生成任务;以及 (3) 数据集、标注和评估协议的完全开源。该数据集可在 https://github.com/acappemin/Video-to-Audio-and-Piano 公开获取,并设有持续更新的排行榜以促进该领域的持续研究。

关键词

引用

@article{arxiv.2505.20038,
  title  = {Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks},
  author = {Chang Liu and Haomin Zhang and Shiyu Xia and Zihao Chen and Chaofan Ding and Xin Yue and Huizhe Chen and Xinhan Di},
  journal= {arXiv preprint arXiv:2505.20038},
  year   = {2025}
}

备注

4 pages, 1 figure, accepted by CVPR 2025 MMFM Workshop