SEA-BED:嵌入模型如何表征东南亚语言?
计算与语言
2026-04-09 v3
摘要
多语言文本嵌入通常被认为是在与视角无关的语义空间中编码意义,从而在不同任务和语言间产生稳定的相似性判断。我们的结果表明,这一假设在实践中并不成立。我们引入了 SEA-BED,一个涵盖 10 种东南亚语言和多种嵌入任务的大规模基准,旨在系统性地考察嵌入性能如何随任务、语言以及语言-任务组合而变化。通过广泛的评估,我们观察到没有一个模型能在所有东南亚语言上表现一致良好;不同语言内部的任务难度差异显著,且在一项任务上的成功并不能可靠地泛化到其他任务。语言-任务分析进一步揭示了高度非均匀的性能景观,即性能在不同的语言-任务组合间存在差异。这些发现呼吁更密切关注那些能提供跨语言和跨任务广阔视角的性能测量,以揭示语义表征中的不一致性。基于这些观察,我们为未来的模型开发提供了见解,包括数据、算法和架构方面的考虑。
引用
@article{arxiv.2508.12243,
title = {SEA-BED: How Do Embedding Models Represent Southeast Asian Languages?},
author = {Wuttikorn Ponwitayarat and Peerat Limkonchotiwat and Raymond Ng and Jann Railey Montalan and Thura Aung and Jian Gang Ngui and Yosephine Susanto and William Chandra Tjhi and Panuthep Tasawong and Erik Cambria and Ekapol Chuangsuwanich and Sarana Nutanong},
journal= {arXiv preprint arXiv:2508.12243},
year = {2026}
}