Rhapsody:面向播客高光片段检测的数据集
计算与语言
2025-09-09 v2
摘要
播客已成为五亿用户的日常伴侣。鉴于可用的播客内容海量,高光片段提供了有价值的信号,帮助听众了解单集要点并决定是否值得投入时间完整收听。然而,由于内容非结构化且篇幅长的特点,自动识别高光片段极具挑战。我们引入了 Rhapsody,一个包含 13K 期播客的数据集,并配以源自 YouTube“最多回放”功能的片段级高光分数。我们将播客高光检测构建为片段级二分类任务。我们探索了多种基线方法,包括语言模型的零样本提示以及使用片段级分类头的轻量级微调语言模型。实验结果表明,即使是 GPT-4o 和 Gemini 等 SOTA 语言模型在此任务上也面临困难,而使用领域内数据微调的模型则显著优于其零样本性能。微调模型受益于同时利用语音信号特征和文本转录。这些发现突显了长篇语音媒体中细粒度信息访问的挑战。
引用
@article{arxiv.2505.19429,
title = {Rhapsody: A Dataset for Highlight Detection in Podcasts},
author = {Younghan Park and Anuj Diwan and David Harwath and Eunsol Choi},
journal= {arXiv preprint arXiv:2505.19429},
year = {2025}
}
备注
COLM 2025