中文

ViPE:可视化几乎一切事物

计算与语言 2023-10-17 v1 计算机视觉与模式识别

摘要

比喻性和非字面表达在人类交流中深度融合。将此类表达可视化能够传达我们的创造性想法,并唤起细腻的情感。另一方面,诸如 Stable Diffusion 等近期的文本到图像模型难以描绘非字面表达。近期的研究主要通过小规模编译人工标注数据集来解决此问题,这不仅需要专业知识,而且效率极低。为解决该问题,我们提出了 ViPE:可视化几乎一切事物(Visualise Pretty-much Everything)。ViPE 提供了一系列轻量且鲁棒的语言模型,这些模型在大规模歌词数据集上训练,该数据集带有代表其隐含意义的含噪视觉描述。这些合成视觉描述由 GPT3.5 生成,既不依赖人工标注也不依赖图像。ViPE 能将任意文本有效转化为可可视化描述,从而实现有意义且高质量的图像生成。我们提供了有力证据,表明 ViPE 在合成视觉阐释方面比 GPT3.5 更鲁棒。ViPE 还展现出可与人类专家相媲美的比喻性表达理解能力,为音乐视频和字幕生成等许多下游应用提供了强大且开源的骨干。

关键词

引用

@article{arxiv.2310.10543,
  title  = {ViPE: Visualise Pretty-much Everything},
  author = {Hassan Shahmohammadi and Adhiraj Ghosh and Hendrik P. A. Lensch},
  journal= {arXiv preprint arXiv:2310.10543},
  year   = {2023}
}

备注

To be presented in EMNLP2023 Main Conference