FLiP:理解多模态多语言句子嵌入
计算与语言
2026-04-21 v1 声音
摘要
本文提出了因子化线性投影(FLiP)模型,用于理解预训练的句子嵌入空间。我们训练 FLiP 模型从多语言(LaBSE)、多模态(SONAR)和 API 基于(Gemini)句子嵌入空间中恢复多个高资源和中资源语言的词汇内容。我们表明 FLiP 能从嵌入中恢复超过 75% 的词汇内容,显著优于现有的非因子化基线。将其作为诊断工具,我们揭示了所选句子编码器在模态和语言方面的偏见,并为实践者提供了关于编码器的内在见解,而无需依赖传统的下游评估任务。我们的实现已公开 https://github.com/BUTSpeechFIT/FLiP。
引用
@article{arxiv.2604.18109,
title = {FLiP: Towards understanding and interpreting multimodal multilingual sentence embeddings},
author = {Santosh Kesiraju and Bolaji Yusuf and Šimon Sedláček and Oldřich Plchot and Petr Schwarz},
journal= {arXiv preprint arXiv:2604.18109},
year = {2026}
}
备注
Under review