HuLA:针对表现力与情感合成语音的韵律感知多任务学习反欺骗
音频与语音处理
2025-09-29 v1 机器学习
声音
摘要
当前的防欺骗系统在面对表现力与情感合成语音时仍然存在脆弱性,因为它们很少利用韵律作为判别线索。韵律是人类表现力和情感的核心,人类本能地使用诸如 F0 模式和浊音/清音结构等韵律线索来区分自然语音与合成语音。在本文中,我们提出了 HuLA,一个用于欺骗检测的两阶段韵律感知多任务学习框架。在阶段 1,以自监督学习 (SSL) 为骨干的模型在真实语音上进行训练,辅助任务为 F0 预测和浊音/清音分类,增强了其捕获类似于人类感知学习的自然韵律变化的能力。在阶段 2,该模型在真实和合成数据上联合优化欺骗检测和韵律任务,利用韵律感知来检测自然语音与表现力合成语音之间的不匹配。实验表明,HuLA 在具有挑战性的域外数据集上始终优于强基线,包括表现力、情感和跨语言攻击。这些结果表明,显式的韵律监督结合 SSL 嵌入,显著提高了对高级合成语音攻击的鲁棒性。
引用
@article{arxiv.2509.21676,
title = {HuLA: Prosody-Aware Anti-Spoofing with Multi-Task Learning for Expressive and Emotional Synthetic Speech},
author = {Aurosweta Mahapatra and Ismail Rasim Ulgen and Berrak Sisman},
journal= {arXiv preprint arXiv:2509.21676},
year = {2025}
}
备注
Submitted to IEEE Transactions on Affective Computing