中文

S2Cap:歌唱风格描述基准与基线方法

计算与语言 2025-08-19 v3 人工智能 机器学习 声音 音频与语音处理

摘要

歌声包含比普通语音丰富得多的信息,包括多样的声音和声学特性。然而,当前用于歌声的开源音频-文本数据集仅捕获了狭窄范围的属性,并且缺乏声学特征,导致其对下游任务(如风格描述)的实用性有限。为填补这一空白,我们正式定义了歌唱风格描述任务,并提出了 S2Cap,这是一个包含详细描述的歌声数据集,涵盖了多样的声音、声学和人口统计学特征。利用该数据集,我们开发了一种高效且直接的歌唱风格描述基线算法。该数据集可在 https://zenodo.org/records/15673764 获取。

关键词

引用

@article{arxiv.2409.09866,
  title  = {S2Cap: A Benchmark and a Baseline for Singing Style Captioning},
  author = {Hyunjong Ok and Jaeho Lee},
  journal= {arXiv preprint arXiv:2409.09866},
  year   = {2025}
}

备注

CIKM 2025 Resource Paper