TaleForge:面向个性化故事创作的交互式多模态系统
计算机视觉与模式识别
2025-06-30 v1
摘要
故事创作是一种深具个人性和创造性的过程,但现有方法常将用户视为被动消费者,提供通用情节且个性化有限。这削弱了用户的参与感和沉浸感,尤其在个性化风格或外观至关重要的场景中。我们引入TaleForge,一个个性化故事生成系统,集成大型语言模型(LLM)和文本到图像扩散模型,将用户的面部图像嵌入叙事与插图中。TaleForge包含三个相互关联的模块:故事生成模块中,LLM根据用户提示创建叙事和人物描述;个性化图像生成模块,将用户的面部和服装选择融合到人物插图中;背景生成模块创建包含个性化人物的场景背景。用户研究显示,个体作为主角出现的情景提升了参与度和归属感。用户赞赏系统的实时预览和直观控制,虽然也表示希望获得更细致的叙事编辑工具。TaleForge推动了多模态故事创作的发展,通过将个性化文本与图像对齐,创造出沉浸式、以用户为中心的体验。
引用
@article{arxiv.2506.21832,
title = {TaleForge: Interactive Multimodal System for Personalized Story Creation},
author = {Minh-Loi Nguyen and Quang-Khai Le and Tam V. Nguyen and Minh-Triet Tran and Trung-Nghia Le},
journal= {arXiv preprint arXiv:2506.21832},
year = {2025}
}