切换状态空间模型中的联合说话人日记化与跟踪
声音
2021-09-24 v1 人工智能
计算与语言
机器学习
摘要
在进行日记化时说话人可能会四处走动。当使用麦克风阵列时,可以估计出声音起源的瞬时位置,先前的研究表明此类信息可与说话人嵌入在日记化任务中互补。然而,这些方法通常假设说话人在整个会议过程中相当静止。本文放宽了这一假设,提出在统一模型内显式跟踪说话人移动的同时联合执行日记化。我们提出了一个状态空间模型,其中隐状态表示当前活跃说话人的身份以及所有说话人的预测位置。该模型以粒子滤波器实现。在微软富会议转录任务上的实验表明,所提出的联合位置跟踪与日记化方法能够与其他使用位置信息的方法取得相当的性能。
引用
@article{arxiv.2109.11140,
title = {Joint speaker diarisation and tracking in switching state-space model},
author = {Jeremy H. M. Wong and Yifan Gong},
journal= {arXiv preprint arXiv:2109.11140},
year = {2021}
}