中文

PodBench:面向指令感知的音频导向播客脚本生成的综合基准

计算与语言 2026-01-22 v1

摘要

播客脚本生成要求 LLM 从多样的输入中合成结构化、基于语境的对话,然而针对该任务的系统评估资源仍然有限。为弥补这一空白,我们引入了 PodBench,这是一个包含 800 个样本的基准,其输入长达 21K 个 token,并带有复杂的多说话人指令。我们提出了一个多方面的评估框架,将定量约束与基于 LLM 的质量评估相结合。大量实验表明,尽管专有模型通常表现优异,但配备显式推理的开源模型在处理长上下文和多说话人协调方面,相较于标准基线展现出更优的鲁棒性。然而,我们的分析揭示了一个持续存在的差异:高指令遵循度并不能保证高内容实质。PodBench 提供了一个可复现的测试平台,以应对长文本、以音频为中心的生成中的这些挑战。

关键词

引用

@article{arxiv.2601.14903,
  title  = {PodBench: A Comprehensive Benchmark for Instruction-Aware Audio-Oriented Podcast Script Generation},
  author = {Chenning Xu and Mao Zheng and Mingyu Zheng and Mingyang Song},
  journal= {arXiv preprint arXiv:2601.14903},
  year   = {2026}
}