中文

PodEval:面向播客音频生成的多模态评估框架

声音 2025-10-02 v1 人工智能 音频与语音处理

摘要

最近,越来越多的多模态(文本和音频)基准测试相继出现,主要侧重于评估模型的理解能力。然而,对评估生成能力的探索仍然有限,尤其是在开放式长篇幅内容生成方面。重大挑战在于没有参考标准答案、没有统一的评估指标以及不可控的人工评判。在这项工作中,我们以类播客音频生成为切入点,提出了 PodEval,一个全面且设计完善的开源评估框架。在该框架中:1) 我们构建了一个涵盖多种主题的真实世界播客数据集,作为人类级创作质量的参考。2) 我们引入了多模态评估策略,并将复杂任务分解为文本、语音和音频三个维度,对“内容”和“格式”有不同的评估侧重点。3) 针对每种模态,我们设计了相应的评估方法,包括客观指标和主观听音测试。我们在实验中利用了具有代表性的播客生成系统(包括开源、闭源和人工制作)。实验结果对播客生成提供了深入的分析和见解,证明了 PodEval 在评估开放式长篇幅音频方面的有效性。本项目已开源以供公众使用:https://github.com/yujxx/PodEval。

关键词

引用

@article{arxiv.2510.00485,
  title  = {PodEval: A Multimodal Evaluation Framework for Podcast Audio Generation},
  author = {Yujia Xiao and Liumeng Xue and Lei He and Xinyi Chen and Aemon Yat Fei Chiu and Wenjie Tian and Shaofei Zhang and Qiuqiang Kong and Xinfa Zhu and Wei Xue and Tan Lee},
  journal= {arXiv preprint arXiv:2510.00485},
  year   = {2025}
}