面向 NCMMSC 2025 vTAD 挑战赛的 CUHK-EE 系统
音频与语音处理
2026-02-16 v3 声音
摘要
本文介绍了香港中文大学(CUHK)电子工程系(EE)数字信号处理与语音技术实验室(DSP&STL)为第 20 届全国人机语音通信学术会议(NCMMSC 2025)vTAD 挑战赛开发的语音音色属性检测(vTAD)系统。所提出的系统利用 WavLM-Large 嵌入和注意力统计池化(ASTP)来提取稳健的说话人表征,随后使用 Diff-Net 的两个变体,即前馈神经网络(FFN)和基于 Squeeze-and-Excitation 增强的残差 FFN(SE-ResFFN),来比较话语对之间的音色属性强度。实验结果表明,WavLM-Large+FFN 系统对未见过的说话人具有更好的泛化能力,实现了 77.96% 的准确率和 21.79% 的等错误率(EER),而 WavLM-Large+SE-ResFFN 模型在“已见”设置中表现出色,准确率为 94.42%,EER 为 5.49%。这些发现突出了模型复杂性和泛化能力之间的权衡,并强调了架构选择在细粒度说话人建模中的重要性。我们的分析还揭示了说话人身份、标注主观性和数据不平衡对系统性能的影响,指出了未来在提高音色属性检测的稳健性和公平性方面的方向。
引用
@article{arxiv.2507.23266,
title = {CUHK-EE Systems for the vTAD Challenge at NCMMSC 2025},
author = {Aemon Yat Fei Chiu and Jingyu Li and Yusheng Tian and Guangyan Zhang and Tan Lee},
journal= {arXiv preprint arXiv:2507.23266},
year = {2026}
}
备注
Accepted at the 20th National Conference on Man-Machine Speech Communication (NCMMSC 2025)