S2Cap:歌唱风格描述基准与基线方法
计算与语言
2025-08-19 v3 人工智能
机器学习
声音
音频与语音处理
摘要
歌声包含比普通语音丰富得多的信息,包括多样的声音和声学特性。然而,当前用于歌声的开源音频-文本数据集仅捕获了狭窄范围的属性,并且缺乏声学特征,导致其对下游任务(如风格描述)的实用性有限。为填补这一空白,我们正式定义了歌唱风格描述任务,并提出了 S2Cap,这是一个包含详细描述的歌声数据集,涵盖了多样的声音、声学和人口统计学特征。利用该数据集,我们开发了一种高效且直接的歌唱风格描述基线算法。该数据集可在 https://zenodo.org/records/15673764 获取。
引用
@article{arxiv.2409.09866,
title = {S2Cap: A Benchmark and a Baseline for Singing Style Captioning},
author = {Hyunjong Ok and Jaeho Lee},
journal= {arXiv preprint arXiv:2409.09866},
year = {2025}
}
备注
CIKM 2025 Resource Paper