中文

多模态基础模型如何编码文本和语音?关于跨语言和跨模态表征的分析

计算与语言 2025-02-21 v2

摘要

多模态基础模型旨在创建统一的表征空间,以抽象化表面特征,如语言语法或模态差异。为此,我们研究了三个近期模型的内部表征,分析了在文本和语音模态中跨语言的语义等价句子的模型激活。我们的发现表明:1)跨模态表征在模型层次上趋于一致,除了初始层在文本和语音处理方面具有专门化。2)长度适应对于减少文本与语音之间的跨模态差距至关重要,尽管当前方法的有效性主要仅限于高资源语言。3)语音在跨语言差异方面大于文本。4)对于没有明确针对模态无关表征进行训练的模型,模态差距大于语言差距。

关键词

引用

@article{arxiv.2411.17666,
  title  = {How do Multimodal Foundation Models Encode Text and Speech? An Analysis of Cross-Lingual and Cross-Modal Representations},
  author = {Hyunji Lee and Danni Liu and Supriti Sinhamahapatra and Jan Niehues},
  journal= {arXiv preprint arXiv:2411.17666},
  year   = {2025}
}

备注

NAACL 2025