多语言 DALL-E 讲故事
计算与语言
2022-12-26 v1
摘要
尽管人工智能(AI)语言模型近期在英语文本上取得了前沿性能,但其他语言中要么不存在等效模型,要么达不到同等水平。这种 AI 进展带来的非预期效应加剧了全球不同人群获取新技术的差距。这一未被寻求的偏见主要歧视英语能力较弱的个体,例如非英语母语儿童。随着近年来 AI 研究的重大进展,OpenAI 近期推出了 DALL-E:一种基于英语文本提示生成图像的强大工具。虽然 DALL-E 在许多应用中前景广阔,但其在非英语输入下性能下降,限制了受众并加深了人群间的差距。当前 DALL-E 模型的另一局限是仅能针对给定输入提示生成少量图像,而非讲述故事或描述随时间变化过程的一系列连贯连续帧。在此,我们提出一个易用的自动 DALL-E 讲故事框架,利用现有 DALL-E 模型实现非英语歌曲与故事快速且连贯的可视化,突破了 DALL-E 目前所提供的逐步生成限制。我们展示了该框架能有效可视化非英语文本故事并刻画情节随时间的演变,还能创建叙事并在各帧描述中保持可解释的变化。此外,我们的框架允许用户对故事元素指定约束(如特定地点或语境),并在整个可视化过程中保持一致的风格。
引用
@article{arxiv.2212.11985,
title = {Multi-Lingual DALL-E Storytime},
author = {Noga Mudrik and Adam S. Charles},
journal= {arXiv preprint arXiv:2212.11985},
year = {2022}
}