中文

RadioTalk:一个大规模谈话广播转录语料库

计算与语言 2019-09-18 v1

摘要

我们介绍了 RadioTalk,一个从美国 2018 年 10 月至 2019 年 3 月期间的谈话广播节目中采样得到的语音识别转录语料库。该语料库旨在供自然语言处理、对话分析和社会科学领域的研究人员使用。该语料库包含来自 284,000 小时广播的约 28 亿个自动转录语音词,以及关于语音的元数据,如地理位置、说话人轮次边界、性别和广播节目信息。在本文中,我们总结了我们为何及如何准备该语料库,给出了关于电台、节目和说话人的一些描述性统计,并进行了若干高层分析。

关键词

引用

@article{arxiv.1907.07073,
  title  = {RadioTalk: a large-scale corpus of talk radio transcripts},
  author = {Doug Beeferman and William Brannon and Deb Roy},
  journal= {arXiv preprint arXiv:1907.07073},
  year   = {2019}
}

备注

5 pages, 4 figures, accepted by Interspeech 2019