基于大语言模型的自动琴棋歌曲脚本生成多智能体框架
人工智能
2025-04-23 v1
摘要
本文提出一种新型多智能体框架,通过集成大语言模型、视觉生成与文本转语音技术,自动化地完成琴棋歌曲的全流程制作。三个专职智能体依次协作:Agent1 使用 LLM 创作连贯且符合文化背景的脚本;Agent2 采用视觉生成模型渲染出语境恰当的舞台场景;Agent3 利用 TTS 产生同步且带情感表达的人声表演。在豆额元试验中,该系统获得了脚本忠实度3.8分、视觉连贯性3.5分、语音准确性3.8分,综合得分3.6,较单智能体基线提升0.3分。消融实验表明,移除 Agent2 或 Agent3 将导致分别下降0.4和0.5分,凸显模块化协作的价值。本工作展示了 AI 驱动的管道如何简化并扩展传统戏曲的保存,同时指向跨模态对齐、更丰富情感细腻程度以及对更多戏曲类型支持的未来提升方向。
引用
@article{arxiv.2504.15552,
title = {A Multi-Agent Framework for Automated Qinqiang Opera Script Generation Using Large Language Models},
author = {Gengxian Cao and Fengyuan Li and Hong Duan and Ye Yang and Bofeng Wang and Donghe Li},
journal= {arXiv preprint arXiv:2504.15552},
year = {2025}
}
备注
17 pages,7 figures,1 tables