我的声音像谁?通过YouTube语音搜索展示说话人识别技术
音频与语音处理
2019-02-12 v2 声音
摘要
科学普及常被科学家忽视,因为将高度复杂的研究转化为公众可理解的语言颇具挑战。本文旨在通过提出一个具有公众吸引力的概念来展示识别系统,从而帮助向公众呈现说话人识别研究。我们利用来自YouTube的数据,并将其用于一个大规模语音搜索网络应用,该应用可找出与用户声音最匹配的名人声音。该概念在公开活动及“真实环境”中进行了测试,收到的反馈总体积极。基于i-vector的说话人识别后端被证实速度快(每次请求665毫秒)且对YouTube目标说话人识别准确率高(93%)。为助力其他研究者进一步发展该思路,我们在 https://github.com/bilalsoomro/speech-demo-platform 分享了用于演示的网络平台源代码。
引用
@article{arxiv.1811.03293,
title = {Who Do I Sound Like? Showcasing Speaker Recognition Technology by YouTube Voice Search},
author = {Ville Vestman and Bilal Soomro and Anssi Kanervisto and Ville Hautamäki and Tomi Kinnunen},
journal= {arXiv preprint arXiv:1811.03293},
year = {2019}
}
备注
Accepted for presentation in ICASSP 2019