中文

FLiP:理解多模态多语言句子嵌入

计算与语言 2026-04-21 v1 声音

摘要

本文提出了因子化线性投影(FLiP)模型,用于理解预训练的句子嵌入空间。我们训练 FLiP 模型从多语言(LaBSE)、多模态(SONAR)和 API 基于(Gemini)句子嵌入空间中恢复多个高资源和中资源语言的词汇内容。我们表明 FLiP 能从嵌入中恢复超过 75% 的词汇内容,显著优于现有的非因子化基线。将其作为诊断工具,我们揭示了所选句子编码器在模态和语言方面的偏见,并为实践者提供了关于编码器的内在见解,而无需依赖传统的下游评估任务。我们的实现已公开 https://github.com/BUTSpeechFIT/FLiP。

关键词

引用

@article{arxiv.2604.18109,
  title  = {FLiP: Towards understanding and interpreting multimodal multilingual sentence embeddings},
  author = {Santosh Kesiraju and Bolaji Yusuf and Šimon Sedláček and Oldřich Plchot and Petr Schwarz},
  journal= {arXiv preprint arXiv:2604.18109},
  year   = {2026}
}

备注

Under review