中文

将 DOVER-Lap 标签映射重构为图划分问题

音频与语音处理 2021-06-07 v2 声音

摘要

我们近期提出了 DOVER-Lap,一种用于融合重叠感知说话人日志系统输出的方法。DOVER-Lap 通过使用基于全局信息贪婪搜索的标签映射方法,改进了其前身 DOVER。在本文中,我们在最大正交图划分问题的框架下分析该标签映射,并给出三点推论。首先,我们表明 DOVER-Lap 标签映射在输入规模上是指数级的,这在融合大量假设时构成挑战。随后我们重新审视 DOVER 标签映射算法,并提出一种改进,其在性能上接近 DOVER-Lap 且计算上易处理。我们还推导了该算法关于假设中说话人最大数量的近似界。最后,我们描述了一种随机局部搜索算法,它以高概率为该问题提供近最优的 (1ϵ)(1-\epsilon) 近似解。我们在 AMI 会议语料库上实证展示了方法的有效性。我们的代码公开可用:https://github.com/desh2608/dover-lap。

关键词

引用

@article{arxiv.2104.01954,
  title  = {Reformulating DOVER-Lap Label Mapping as a Graph Partitioning Problem},
  author = {Desh Raj and Sanjeev Khudanpur},
  journal= {arXiv preprint arXiv:2104.01954},
  year   = {2021}
}

备注

5 pages, 3 figures. Acceped at INTERSPEECH 2021