Story3D-Agent:基于大语言模型的 3D 叙事可视化探索
计算机视觉与模式识别
2024-08-22 v1
摘要
传统的视觉叙事复杂且需要专业知识和大量资源,往往受限于人类创意和创作精度。虽然大型语言模型(LLM)提升了视觉叙事,但当前方法往往仅限于 2D 视觉或通过运动合成和行为模拟简化故事,无法创建全面、多维度的叙事。为此,我们提出 Story3D-Agent,一种 pioneering 方法,利用 LLM 的能力将提供的叙事转化为 3D 渲染可视化。通过集成程序化建模,我们的方法实现对多角色动作和运动以及多样化装饰元素的精确控制,确保长期范围和动态的 3D 表示。此外,我们的方法支持通过逻辑推理扩展叙事,确保生成内容与现有条件一致。我们全面评估了 Story3D-Agent 以验证其有效性,为 3D 故事表示提供了一个基本框架,以推动该领域的发展。
引用
@article{arxiv.2408.11801,
title = {Story3D-Agent: Exploring 3D Storytelling Visualization with Large Language Models},
author = {Yuzhou Huang and Yiran Qin and Shunlin Lu and Xintao Wang and Rui Huang and Ying Shan and Ruimao Zhang},
journal= {arXiv preprint arXiv:2408.11801},
year = {2024}
}
备注
Project page: https://yuzhou914.github.io/Story3D-Agent/