中文

利用结构化播客研究语料库绘制播客生态系统图谱

计算与语言 2025-12-22 v2 计算机与社会

摘要

播客通过独特的点播模式向庞大的听众群体提供高度多样化的内容。然而,有限的数据阻碍了对播客生态系统的大规模计算分析。为了填补这一空白,我们引入了一个包含超过110万份播客转录文本的大规模数据集,该数据集全面涵盖了2020年5月和6月通过公共RSS源获取的所有英语播客。这些数据不仅限于文本,还包括37万集子集的音频特征和说话人轮次,以及所有110万集的说话人角色推断和其他元数据。利用这些数据,我们还对该生态系统的内容、结构和响应性进行了基础性研究。我们的数据和分析共同为这一流行且有影响力的媒体持续进行计算研究打开了大门。

关键词

引用

@article{arxiv.2411.07892,
  title  = {Mapping the Podcast Ecosystem with the Structured Podcast Research Corpus},
  author = {Benjamin Litterer and David Jurgens and Dallas Card},
  journal= {arXiv preprint arXiv:2411.07892},
  year   = {2025}
}

备注

9 pages, 3 figures