中文

场景精炼器:在形态学层面将主体锚定于图像中

计算与语言 2023-09-21 v1 计算机视觉与模式识别

摘要

派生相关词,如“runner”与“running”,呈现出语义差异,这些差异也会引发不同的视觉场景。在本文中,我们利用一种新方法与新数据集,探讨视觉与语言(V&L)模型是否在形态学层面捕捉到此类区别。我们将 V&L 模型的预测结果与人类判断进行比较,发现模型的预测不同于人类参与者的预测,尤其表现出一种语法偏见。我们进一步探究这种人机不一致是否与模型架构相关。我们的方法基于一种特定的形态学对比而开发,可进一步扩展用于测试模型对其他细微语言特征的捕捉能力。

关键词

引用

@article{arxiv.2309.11252,
  title  = {The Scenario Refiner: Grounding subjects in images at the morphological level},
  author = {Claudia Tagliaferri and Sofia Axioti and Albert Gatt and Denis Paperno},
  journal= {arXiv preprint arXiv:2309.11252},
  year   = {2023}
}

备注

presented at the LIMO workshop (Linguistic Insights from and for Multimodal Language Processing @KONVENS 2023)