想听见你的声音?只需一个样本!
音频与语音处理
2025-06-10 v4
摘要
音线索驱动的目标说话人提取(TSE)研究聚焦于建模混合信号和参考语音,由于数据丰富,已在英语方面取得显著成果。然而,跨语言特性仍未得到充分探索,因为低资源语言面临数据和语言资源有限的挑战。为填补这一差距,我们提出了 WHYV(Wanna Hear Your Voice),一个实现零样本适应且无需微调的跨语言 TSE 框架。WHYV 采用频率调制门控机制,动态调整目标说话人的声学特征,最小化对语言特定线索的依赖。评估显示其零样本性能达到最先进水平:Libri2Mix mix-both 为 13.8 dB,mix-clean 为 18.1 dB,越南语数据为 14.8 dB。
引用
@article{arxiv.2410.00527,
title = {Wanna hear your voice? A sample is all we need!},
author = {The Hieu Pham and Phuong Thanh Tran Nguyen and Xuan Tho Nguyen and Tan Dat Nguyen and Duc Dung Nguyen},
journal= {arXiv preprint arXiv:2410.00527},
year = {2025}
}
备注
work in progress