Vistoria: 支持文本-图像协同编辑的虚构故事写作多模态系统
人机交互
2026-02-06 v3
摘要
人类思维是视觉的-我们在图像中记忆、在图片中梦想、并用视觉隐喻进行交流。然而,大多数创意写作工具仍以文本为中心,限制了作者如何计划和转化思想。我们提出了 Vistoria,一个用于虚构故事写作中同步文本-图像协同编辑的系统,将视觉和文本视为平等的叙事材料。10 位故事作家进行的 Wizard-of-Oz 形式化共同设计研究揭示了草图、图像和注释作为思想发展和组织的关键工具。基于 Instrumental Interaction 和 Structural Mapping 理论,Vistoria 引入了多模态操作-lasso、拼贴、滤镜和视角转换,使作者能够在不同模态之间实现无缝叙事探索。12 名参与者的受控研究显示,协同编辑增强了表达性、沉浸感和合作性,使作者能够探索不同的方向、拥抱偶然的随机性并追踪演变的情节线。虽然多模态性增加了认知需求,但参与者报告更强的作者身份和主体能量。这些发现表明,多模态协同编辑通过平衡叙事发展中抽象与具体性,拓展了创意潜能。
引用
@article{arxiv.2509.13646,
title = {Vistoria: A Multimodal System to Support Fictional Story Writing through Instrumental Text-Image Co-Editing},
author = {Kexue Fu and Jingfei Huang and Long Ling and Sumin Hong and Yihang Zuo and Ray LC and Toby Jia-jun Li},
journal= {arXiv preprint arXiv:2509.13646},
year = {2026}
}
备注
Change the format of the first page