PodAgent:用于播客生成的综合框架
声音
2025-03-04 v1 人工智能
多智能体系统
多媒体
音频与语音处理
摘要
现有的自动音频生成方法在有效生成类似播客的音频程序方面存在挑战。关键问题在于深入的内容生成、恰当且有表现力的语音制作。本文提出了 PodAgent,一个用于创建音频程序的综合框架。PodAgent 1) 通过设计 Host-Guest-Writer 多主体协作系统生成信息性话题讨论内容,2) 构建语音池用于语音角色匹配,3) 利用增强式语音合成方法生成具有表现力的对话语音。由于缺乏针对类似播客音频生成的标准化评估标准,我们开发了全面的评估指南来有效评估模型性能。实验结果表明,PodAgent 的有效性显著优于直接使用 GPT-4生成的话题讨论对话内容,实现了 87.4% 的语音匹配准确率,并通过 LLM 指导的合成方法生成更具表现力的语音。演示页面:https://podcast-agent.github.io/demo/。源码:https://github.com/yujxx/PodAgent。
关键词
引用
@article{arxiv.2503.00455,
title = {PodAgent: A Comprehensive Framework for Podcast Generation},
author = {Yujia Xiao and Lei He and Haohan Guo and Fenglong Xie and Tan Lee},
journal= {arXiv preprint arXiv:2503.00455},
year = {2025}
}