Audiocards:结构化元数据改善声乐模型用于声效设计
声音
2026-02-17 v1
摘要
声设计师通过声音类别或视觉语境等方面在大型声效图书馆中搜索声音。然而,这些搜索所需的元数据往往缺失或不完整,需要大量的人工工作才能添加。现有的自动生成此类元数据(即生成标题)并通过学习嵌入进行搜索的解决方案,并未在结构化且符合声效设计信息需求的元数据上进行训练。为此,我们提出 audiocards,这种基于声学属性和声音描述符的结构化元数据,利用大语言模型(LLM)的世界知识。我们表明,在专业声效图书馆上训练 audiocards 可改善下游文本-音频检索、描述性标题生成和元数据生成。此外,audiocards 还能在基线单句标题方法上提升通用音频标题生成和检索性能。我们发布了精选的声效 audiocards 数据集,以邀请进一步的研究在声效设计领域的音频语言建模。
引用
@article{arxiv.2602.13835,
title = {Audiocards: Structured Metadata Improves Audio Language Models For Sound Design},
author = {Sripathi Sridhar and Prem Seetharaman and Oriol Nieto and Mark Cartwright and Justin Salamon},
journal= {arXiv preprint arXiv:2602.13835},
year = {2026}
}
备注
Accepted at ICASSP 2026