中文

视觉基础的好奇案例:基于语音与文本的语言编码器的不同效应

计算与语言 2025-09-22 v1

摘要

训练中包含的视觉信息如何影响基于语音和文本的深度学习模型中的语言处理?我们探讨了这种视觉基础如何影响模型内部的词表示,并发现基于语音与基于文本的语言编码器中存在显著不同的效应。首先,全局表示比较表明,视觉基础增加了口语和书面语表示之间的对齐度,但这种效应似乎主要由词身份的增强编码而非意义驱动。随后,我们应用针对性聚类分析来探测模型表示中的语音与语义可区分性。基于语音的表示在视觉基础下仍以语音为主导,但与基于文本的表示不同,视觉基础并未改善其语义可区分性。我们的发现可为开发更高效的方法以利用视觉语义丰富基于语音的模型提供有益参考。

关键词

引用

@article{arxiv.2509.15837,
  title  = {The Curious Case of Visual Grounding: Different Effects for Speech- and Text-based Language Encoders},
  author = {Adrian Sauter and Willem Zuidema and Marianne de Heer Kloots},
  journal= {arXiv preprint arXiv:2509.15837},
  year   = {2025}
}

备注

5 pages, 3 figures, Submitted to ICASSP 2026