从自动生成转录文本中识别播客剧集中的引言部分
计算与语言
2021-12-13 v2
摘要
随着播客等长篇口语内容的体量激增,许多平台希望从完整内容中提取简短、有意义且逻辑连贯的片段。用户可在深入收听前通过这些片段预览内容,平台也可借此推广与推荐内容。然而,已发表的有关口语内容分割的研究甚少,其中自动语音识别(ASR)服务生成的转录文本中的错误(噪声)带来了诸多挑战。本文构建了包含 400 余集播客完整转录文本的新数据集,并标注了每集中引言的位置。这些引言包含关于剧集主题、主持人与嘉宾的信息,由作者创作,因而提供了剧集内容的有价值摘要。我们进一步通过词语替换扩充数据集,以增加可用训练数据量。我们基于预训练 BERT 与不同增强策略训练了三个 Transformer 模型,其性能显著优于静态嵌入模型,表明有可能从含噪声、松散组织的语音数据中捕获广义的、更大尺度的结构信息。通过对模型内部架构的分析进一步证实了这一点。我们的方法与数据集可用于促进未来基于结构的口语内容分割研究。
引用
@article{arxiv.2110.07096,
title = {Identifying Introductions in Podcast Episodes from Automatically Generated Transcripts},
author = {Elise Jing and Kristiana Schneck and Dennis Egan and Scott A. Waterman},
journal= {arXiv preprint arXiv:2110.07096},
year = {2021}
}
备注
Accepted in PodRecs 2021, a RecSys workshop. The dataset has been published at https://zenodo.org/record/5765655#.YbFhS33MJTY