中文

双语视觉接地语音模型的互斥性偏差

计算与语言 2025-06-05 v1 音频与语音处理

摘要

互斥性(ME)是一种策略,将新词与新颖物体而非熟悉物体相关联,从而促进儿童的语言学习。近期工作发现,在以英语语音配对的图像训练的视觉接地语音(VGS)模型中存在ME偏差。但ME也在双语儿童中被研究,他们可能由于跨语言歧义而较少使用它。我们使用在英语、法语和荷兰语组合上训练的双语VGS模型以计算方式探索这一模式。我们发现双语模型通常表现出比单语模型更弱的ME偏差,尽管存在例外。分析表明,双语模型的组合视觉嵌入对熟悉数据具有更小的方差,部分解释了新颖概念与熟悉概念之间混淆的增加。我们还提供了关于VGS模型中为何最初存在ME偏差的新见解。代码和数据:https://github.com/danoneata/me-vgs

关键词

引用

@article{arxiv.2506.04037,
  title  = {The mutual exclusivity bias of bilingual visually grounded speech models},
  author = {Dan Oneata and Leanne Nortje and Yevgen Matusevych and Herman Kamper},
  journal= {arXiv preprint arXiv:2506.04037},
  year   = {2025}
}

备注

Interspeech 2025