SENSE模型:面向多语言多模态语义任务的开源解决方案
计算与语言
2025-12-10 v2
摘要
本文介绍SENSE(Shared Embedding for N-lingual Speech and tExt),一种受SAMU-XLSR框架启发、概念类似于Meta AI SONAR模型的开源解决方案。这些方法依赖教师-学生框架,在 utterance 级别对自监督语音编码器与文本编码器的语言无关连续表示进行对齐。我们描述了如何更新原始SAMU-XLSR方法,通过选择更强的教师文本模型和更好的初始语音编码器。SENSE模型的训练与使用源码已集成至SpeechBrain工具包,我们训练的首个SENSE模型已公开发布。我们报告了在多语言和多模态语义任务上的实验结果,其中我们的SENSE模型在性能上表现出高度具竞争力。最后,本研究为如何在此类语义对齐语音编码器中捕获语义提供了新见解。
关键词
引用
@article{arxiv.2509.12093,
title = {SENSE models: an open source solution for multilingual and multimodal semantic-based tasks},
author = {Salima Mdhaffar and Haroun Elleuch and Chaimae Chellaf and Ha Nguyen and Yannick Estève},
journal= {arXiv preprint arXiv:2509.12093},
year = {2025}
}
备注
Accepted to IEEE ASRU 2025