openFEAT:基于 Transformer 的开放集少样本嵌入自适应改进说话人识别
音频与语音处理
2024-02-09 v1
摘要
使用少量注册语句的家庭说话人识别是一个重要且具有挑战性的问题,尤其是当家庭成员具有相似语音特征和房间声学特性时。从大量说话人上学得的通用嵌入空间,并不普遍适用于家庭中每个说话人的最优识别。在本工作中,我们首先将家庭说话人识别形式化为一个少样本开放集识别任务,然后提出一种新颖的嵌入自适应框架,利用集到集函数将说话人表征从给定的通用嵌入空间自适应到家庭特定嵌入空间,从而获得更好的家庭说话人识别性能。借助我们的算法——基于 Transformer 的开放集少样本嵌入自适应(openFEAT),我们观察到在具有 2 至 7 个难以区分说话人的模拟家庭中,说话人识别等错误率(IEER)相对降低了 23% 至 31%。
引用
@article{arxiv.2202.12349,
title = {openFEAT: Improving Speaker Identification by Open-set Few-shot Embedding Adaptation with Transformer},
author = {Kishan K C and Zhenning Tan and Long Chen and Minho Jin and Eunjung Han and Andreas Stolcke and Chul Lee},
journal= {arXiv preprint arXiv:2202.12349},
year = {2024}
}
备注
To appear in Proc. IEEE ICASSP 2022