中文

Toyteller:基于玩具角色符号的人类智能驱动的视觉叙事系统

人机交互 2025-01-24 v1 人工智能 计算与语言

摘要

我们介绍 Toyteller,这是一个由用户通过直接操控角色符号进行玩具式互动的 AI 驱动叙事系统,用户可通过这种方式生成混合了文本和视觉元素的故事。拟人化的符号运动可以传递丰富且细腻的社交互动;Toyteller 利用这些运动 (1) 让用户引导故事文本的生成, (2) 作为伴随故事文本的视觉输出格式。我们通过将运动和文本映射到共享语义空间,实现了运动引导文本生成和文本引导运动生成,使大型语言模型和运动生成模型可将其用作翻译层。技术评估显示,Toyteller 在对抗基线 (GPT-4o) 中表现优异。我们的使用者研究识别出,玩具式互动有助于表达难以用语言表达的意图。然而,仅凭运动无法表达所有用户意图,这表明需要与其他模式(如语言)结合使用。我们讨论了玩具式互动的设计空间以及人机交互技术方面的意义。

关键词

引用

@article{arxiv.2501.13284,
  title  = {Toyteller: AI-powered Visual Storytelling Through Toy-Playing with Character Symbols},
  author = {John Joon Young Chung and Melissa Roemmele and Max Kreminski},
  journal= {arXiv preprint arXiv:2501.13284},
  year   = {2025}
}

备注

Accepted to CHI2025