中文

播客短文本元数据的主题建模

信息检索 2022-01-13 v1 计算与语言

摘要

播客已成为海量消费的在线内容,这尤其得益于制作手段的更广泛可及性以及大型流媒体平台的规模化分发。分类系统与信息获取技术通常以主题作为组织或浏览播客集合的主要方式。然而,为播客标注主题仍相当困难,因为指定的编辑流派宽泛、异构或具误导性,或源于数据挑战(如短元数据文本、含噪转录文本)。在此,我们评估利用短文本主题建模技术从播客元数据、标题与描述中发现相关主题的可行性。我们还提出一种在非负矩阵分解(NMF)主题建模框架中利用播客元数据中常出现的命名实体(NEs)的新策略。我们在来自 Spotify 与 iTunes 的两个现有数据集以及来自提供播客目录的在线服务 Deezer 的新数据集上的实验表明,我们提出的文档表示 NEiCE 相较基线提升了主题一致性。我们发布代码以保证结果实验可复现。

关键词

引用

@article{arxiv.2201.04419,
  title  = {Topic Modeling on Podcast Short-Text Metadata},
  author = {Francisco B. Valero and Marion Baranes and Elena V. Epure},
  journal= {arXiv preprint arXiv:2201.04419},
  year   = {2022}
}

备注

Accepted for publication in the 44nd European Conference on Information Retrieval (ECIR'22)