通过来自人脸嵌入的跨模态迁移学习改进说话人轮次嵌入
计算机视觉与模式识别
2017-07-11 v1
摘要
学习说话人轮次嵌入在传统说话人建模方法失败的情况下显示出可观改进。然而,与在人脸验证和聚类任务中被证明非常成功的人脸嵌入学习所观察到的增益相比,该改进相对有限。假设来自同一身份的人脸和声音共享某些潜在属性(如年龄、性别、种族),我们提出三种迁移学习方法,以利用从数千图像和身份中学习到的人脸域知识用于说话人域任务。这些方法,即目标嵌入迁移、相对距离迁移和聚类结构迁移,利用源人脸嵌入空间的结构在不同粒度上作为优化项来正则化目标说话人轮次嵌入空间。我们的方法在两个公共广播语料库上评估,并在验证和音频聚类任务中相较竞争基线取得有前景的进展,尤其在处短说话人语句时。结果分析也洞察了嵌入空间的特性并展示了其潜在应用。
引用
@article{arxiv.1707.02749,
title = {Improving speaker turn embedding by crossmodal transfer learning from face embedding},
author = {Nam Le and Jean-Marc Odobez},
journal= {arXiv preprint arXiv:1707.02749},
year = {2017}
}