中文

引入语音音色属性检测

声音 2025-06-24 v2 人工智能 音频与语音处理

摘要

本文旨在解释语音信号所传递的音色特征,提出了一种称为语音音色属性检测(voice timbre attribute detection, vTAD)的任务。在该任务中,语音音色通过一组描述其人类感知的感官属性进行解释。对处理成对的语音语音进行处理,并在指定的音色描述符中进行强度比较。此外,本文提出了一个框架,基于从语音语音中提取的说话人嵌入构建。该研究在VCTK-RVA数据集上进行。对ECAPA-TDNN和FACodec说话人编码器的实验检验表明:1)ECAPA-TDNN说话人编码器在已见场景(测试说话人包含在训练集中)中更具优势;2)FACodec说话人编码器在未见场景(测试说话人不包含在训练中)中更优,表明其具有更好的泛化能力。VCTK-RVA数据集和开源代码均可在网站 https://github.com/vTAD2025-Challenge/vTAD 上获取。

关键词

引用

@article{arxiv.2505.09661,
  title  = {Introducing voice timbre attribute detection},
  author = {Jinghao He and Zhengyan Sheng and Liping Chen and Kong Aik Lee and Zhen-Hua Ling},
  journal= {arXiv preprint arXiv:2505.09661},
  year   = {2025}
}

备注

arXiv admin note: substantial text overlap with arXiv:2505.09382