从文字到世界:通过具备交际能力的大语言模型代理将单行提示转化为沉浸式多模态数字故事
计算与语言
2024-06-24 v2 人工智能
图形学
摘要
数字叙事是娱乐、教育和营销领域的关键元素,但面临生产规模性和灵活性的挑战。本文介绍的StoryAgent框架利用大语言模型和生成工具实现数字叙事的自动化和精细化。采用自上而下的故事草拟与自下而上的资产生成方法,StoryAgent解决了手动干预、交互式场景编排和叙事一致性等关键问题。该框架实现了跨多模态高效、一致的叙事生产, democratizes 内容创建并增强参与度。我们的结果表明,该框架能够在无参考视频的情况下生成连贯的数字故事,标志着自动化数字叙事领域的重大进步。
关键词
引用
@article{arxiv.2406.10478,
title = {From Words to Worlds: Transforming One-line Prompt into Immersive Multi-modal Digital Stories with Communicative LLM Agent},
author = {Samuel S. Sohn and Danrui Li and Sen Zhang and Che-Jui Chang and Mubbasir Kapadia},
journal= {arXiv preprint arXiv:2406.10478},
year = {2024}
}
备注
16 pages, 13 figures