中文

Kiki 还是 Bouba?视觉-语言模型中的声音象征性

计算机视觉与模式识别 2024-04-03 v3 计算与语言 机器学习

摘要

尽管人类语言中声音与意义之间的映射被认为在很大程度上是任意的,但认知科学的研究表明,跨语言与人口群体间特定声音与意义之间存在非平凡的相关性,这一现象被称为声音象征性(sound symbolism)。在意义的诸多维度中,声音象征性在语言与视觉领域之间的跨模态关联上尤为显著且得到充分证明。本工作中,我们探讨视觉-语言模型(如 CLIP 与 Stable Diffusion)是否反映了声音象征性。利用零样本知识探测(zero-shot knowledge probing)考察这些模型的固有知识,我们发现有力证据表明它们确实呈现该模式,与心理语言学中所熟知的 kiki-bouba 效应相平行。我们的工作提供了一种利用计算工具展示声音象征性并理解其本质的新方法。我们的代码将公开可用。

关键词

引用

@article{arxiv.2310.16781,
  title  = {Kiki or Bouba? Sound Symbolism in Vision-and-Language Models},
  author = {Morris Alper and Hadar Averbuch-Elor},
  journal= {arXiv preprint arXiv:2310.16781},
  year   = {2024}
}

备注

Accepted to NeurIPS 2023 (spotlight). Project webpage: https://kiki-bouba.github.io/