PODTILE:用于播客剧集浏览的自动生成章节
信息检索
2024-10-22 v1 人工智能
摘要
长篇对话音频内容(如播客剧集)的听众往往难以理解整体结构并定位相关章节。实际解决方案是将剧集划分为具有标题和时间戳的语义连贯段落。由于我们平台(Spotify)上的大多数剧集目前缺乏创作者提供的章节,因此自动创建章节至关重要。对播客剧集进行章节化处理具有独特挑战。首先,剧集通常不如书面文本结构化,具有自发讨论和细腻过渡。其次,转录稿通常较长,平均约为 16,000 个 token, necessitates 高效处理且能保持上下文。为解决这些挑战,我们引入 PODTILE,一个针对对话数据进行微调的编码器-解码器变换模型,用于分割对话数据。该模型同时为输入转录稿生成章节转换和标题。为保持上下文,每个输入文本都增强了全局上下文,包括剧集标题、描述以及前一章节标题。在我们的内在评估中,PODTILE 相对于最强基线实现了 11% 的 ROUGE 分数提升。此外,我们提供了关于自动生成章节对听众浏览剧集内容具有实际益处的见解。我们的发现表明,自动生成的章节是与较少知名的播客进行交互的有用工具。最后,我们提出了使用章节标题可提高稀疏检索任务中效果的实证证据。
关键词
引用
@article{arxiv.2410.16148,
title = {PODTILE: Facilitating Podcast Episode Browsing with Auto-generated Chapters},
author = {Azin Ghazimatin and Ekaterina Garmash and Gustavo Penha and Kristen Sheets and Martin Achenbach and Oguz Semerci and Remi Galvez and Marcus Tannenberg and Sahitya Mantravadi and Divya Narayanan and Ofeliya Kalaydzhyan and Douglas Cole and Ben Carterette and Ann Clifton and Paul N. Bennett and Claudia Hauff and Mounia Lalmas},
journal= {arXiv preprint arXiv:2410.16148},
year = {2024}
}
备注
9 pages, 4 figures, CIKM industry track 2024