测量音声符号在音视频模型中的表现
计算与语言
2024-11-13 v3 计算机视觉与模式识别
声音
音频与语音处理
摘要
音视频预训练模型最近受到广泛关注,并在 various audio-visual 任务上展现出优异性能。本研究探讨了预训练音视频模型是否显示出与声音和视觉表征之间非任意关联——即声音符号(sound symbolism)——这种现象也在人类中被观察到。我们开发了一套包含合成图像和音频样本的专门数据集,并以无监督方式评估了这些模型。我们的发现表明,这些模型的输出与已建立的声音符号模式之间存在显著相关性,尤其是在针对语音数据进行训练的模型中。这些结果表明,这些模型能够捕捉类似于人类语言处理的声音-意义联系,为理解认知架构和机器学习策略提供了洞见。
引用
@article{arxiv.2409.12306,
title = {Measuring Sound Symbolism in Audio-visual Models},
author = {Wei-Cheng Tseng and Yi-Jen Shih and David Harwath and Raymond Mooney},
journal= {arXiv preprint arXiv:2409.12306},
year = {2024}
}
备注
SLT 2024