Diff4Steer: 面向语义引导的生成式音乐检索的可引导扩散先验
声音
2025-04-25 v1 信息检索
多媒体
音频与语音处理
摘要
现代音乐检索系统通常依赖用户偏好的固定表征,限制了其捕捉用户多样且不确定的检索需求的能力。为解决这一局限,我们提出了 Diff4Steer,一种新颖的生成式检索框架,利用轻量级扩散模型从用户查询中合成多样化的种子嵌入,以表征音乐探索的潜在方向。与将用户查询映射到嵌入空间中单个点的确定性方法不同,Diff4Steer 为目标模态(音频)提供了统计先验,有效捕捉了用户偏好的不确定性和多面性。此外,Diff4Steer 可由图像或文本输入进行引导,从而实现与最近邻搜索相结合的更具灵活性和可控性的音乐发现。我们的框架在检索和排序指标上优于确定性回归方法和基于大语言模型的生成式检索基线,证明了其在捕捉用户偏好方面的有效性,从而带来更多样化和更相关的推荐。聆听示例可在 tinyurl.com/diff4steer 获取。
引用
@article{arxiv.2412.04746,
title = {Diff4Steer: Steerable Diffusion Prior for Generative Music Retrieval with Semantic Guidance},
author = {Xuchan Bao and Judith Yue Li and Zhong Yi Wan and Kun Su and Timo Denk and Joonseok Lee and Dima Kuzmin and Fei Sha},
journal= {arXiv preprint arXiv:2412.04746},
year = {2025}
}
备注
NeurIPS 2024 Creative AI Track