中文

GEST:作为视觉与语言间公共表示的时空事件图

计算与语言 2023-05-23 v1

摘要

人类的一项基本能力是能够无缝地构建世界的内在表示。通过利用该表示,人类能够轻易地在视觉、听觉与语言视角间达成共识。在本工作中,我们旨在通过一种针对视觉与语言的显式表示——时空事件图(GEST)来理解并模拟这一能力。GEST使我们能够通过图匹配以语义且完全可解释的方式度量文本与视频之间的相似性。它还允许我们从一个提供清晰易懂内容的公共表示生成文本和视频。本工作中我们展示了基于GEST的图匹配相似性度量优于经典的文本生成度量,并且还能提升当前最先进、经过重度训练的度量方法的性能。

关键词

引用

@article{arxiv.2305.12940,
  title  = {GEST: the Graph of Events in Space and Time as a Common Representation between Vision and Language},
  author = {Mihai Masala and Nicolae Cudlenco and Traian Rebedea and Marius Leordeanu},
  journal= {arXiv preprint arXiv:2305.12940},
  year   = {2023}
}