基于紧凑且可解释的无训练声学参数的人声音色属性检测
音频与语音处理
2026-03-06 v1
摘要
人声音色属性检测(vTAD)是确定语音 utterance 之间音色属性相对强度的任务。人声音色是语音感知中至关重要且固有复杂的组成部分。虽然深度神经网络(DNN)嵌入在说话人建模中表现良好,但常作为黑箱表示,具有有限的物理可解释性和高的计算成本。本文我们研究了一个用于 vTAD 的紧凑声学参数集合。该集合捕获重要的声学度量及其时间动力学,这些被发现对于该任务至关重要。尽管该集合简单,仍与传统的声谱特征和监督 DNN 嵌入相比表现竞争力,接近最先进的自监督模型。重要的是,研究的该集合不需可训练参数,计算开销极低,并为分析人类音色感知背后物理特征提供了显式可解释性。
引用
@article{arxiv.2603.05091,
title = {Voice Timbre Attribute Detection with Compact and Interpretable Training-Free Acoustic Parameters},
author = {Aemon Yat Fei Chiu and Yujia Xiao and Qiuqiang Kong and Tan Lee},
journal= {arXiv preprint arXiv:2603.05091},
year = {2026}
}
备注
Under review