HAFM:用于音乐伴奏生成的层次化自回归基础模型
声音
2026-04-14 v2 多媒体
摘要
我们提出 HAFM,一个能够为输入人声生成伴奏音频的系统。给定独立的演唱声音,HAFM 可生成与输入直接混合以制成完整音乐的连贯伴奏。我们在先前工作基础上提出了三个关键创新:(1) 采用 50 Hz 的 HuBERT 语义标记用于人声,采用 75 Hz 的 EnCodec 声学标记用于伴奏,实现时间对齐且率率独立的建模;(2) 采用三阶段层次化自回归架构(语义→粗糙声学→细粒度声学),并交错进行多码本预测和无分类器引导;(3) 采用 QK-norm、GEGLU 激活、RMSNorm 和 T5 样式相对位置偏置等现代 Transformer 设计,以提高训练稳定性和序列泛化能力。在 MUSDB18 数据集上进行实验表明,HAFM 在独立人声输入上的 FAD 为 2.08,超越检索基线,同时以更少的参数匹配先前的 SOTA 系统。源代码已公开于 https://github.com/HackerHyper/HAFM。
引用
@article{arxiv.2604.09054,
title = {HAFM: Hierarchical Autoregressive Foundation Model for Music Accompaniment Generation},
author = {Jian Zhu and Jianwei Cui and Shihao Chen and Yubang Zhang and Cheng Luo},
journal= {arXiv preprint arXiv:2604.09054},
year = {2026}
}
备注
Music Accompaniment Generation, Music Foundation Model