播客转录文本中主题模型对自动语音识别错误的鲁棒性
信息检索
2021-09-28 v1 机器学习
摘要
对于多语言播客流媒体服务而言,能够独立于语言向所有用户交付相关内容至关重要。播客内容相关性传统上由多种元数据来源确定。然而,随着多种语言中语音识别质量的不断提升,利用自动转录文本来提供更好的内容推荐成为可能。在这项工作中,我们探究了将潜在狄利克雷分配(Latent Dirichlet Allocation)主题模型应用于自动语音识别引擎生成的转录文本时的鲁棒性。具体而言,我们探究了不断增加的转录噪声如何影响从丹麦语(一种低资源语言)转录文本中获取的主题。首先,我们观测了自动转录文本的主题嵌入与播客创作者撰写的播客描述之间的余弦相似度基线。随后我们观测了随着转录噪声增加余弦相似度如何下降,并得出结论:即便自动语音识别转录文本存在错误,仍有可能从中获得高质量的主题嵌入。
引用
@article{arxiv.2109.12306,
title = {Topic Model Robustness to Automatic Speech Recognition Errors in Podcast Transcripts},
author = {Raluca Alexandra Fetic and Mikkel Jordahn and Lucas Chaves Lima and Rasmus Arpe Fogh Egebæk and Martin Carsten Nielsen and Benjamin Biering and Lars Kai Hansen},
journal= {arXiv preprint arXiv:2109.12306},
year = {2021}
}