中文

ISDrama:通过多模态提示生成沉浸式空间戏剧

音频与语音处理 2026-02-17 v6 多媒体 声音

摘要

沉浸式空间戏剧生成专注于根据多模态提示创建具有戏剧性韵律的连续多说话者立体声。该任务潜在应用于 AR、VR 等领域。需要同时建模空间信息和戏剧性韵律,数据收集成本高。鉴于目前没有针对这一挑战的研究,我们首次提出 ISDrama。我们构建了 MRSDrama,即首个多模态记录的空间戏剧数据集,包含立体声戏剧音频、剧本、视频、几何姿态和文本提示。随后,我们提出 ISDrama,即首个通过多模态提示实现的沉浸式空间戏剧生成模型。ISDrama 包含以下主要组件:1)多模态姿态编码器,基于对比学习,考虑移动说话者导致的多普勒效应,从多模态提示中提取统一的姿态信息。2)沉浸式戏剧变换器,一种基于流式 mamba 变换器的模型,用于生成高质量戏剧,集成 Drama-MOE 以选择合适的专家以增强韵律和姿态控制。我们还设计了上下文一致的无分类引导策略,以连贯地生成完整戏剧。实验结果表明,ISDrama 在客观和主观指标上均优于基线模型。演示可在 https://aaronz345.github.io/ISDramaDemo 查看。我们在 https://huggingface.co/datasets/AaronZ345/MRSDrama 和 https://github.com/AaronZ345/ISDrama 上提供数据集和评估代码。

关键词

引用

@article{arxiv.2504.20630,
  title  = {ISDrama: Immersive Spatial Drama Generation through Multimodal Prompting},
  author = {Yu Zhang and Wenxiang Guo and Changhao Pan and Zhiyuan Zhu and Tao Jin and Zhou Zhao},
  journal= {arXiv preprint arXiv:2504.20630},
  year   = {2026}
}

备注

Accepted by ACM Multimedia 2025