越南语大型文本嵌入基准测试 VN-MTEB
计算与语言
2025-07-30 v1 人工智能
摘要
越南位于互联网流量和在线有害内容排名前列,因此为推荐系统和内容控制应用实现嵌入模型至为关键。然而,缺乏规模大且任务多样的测试数据集,使得科学家在部署于实际大规模项目之前有效评估 AI 模型颇具挑战。为解决此重要问题,我们引入一个针对文本嵌入模型的越南语基准测试 VN-MTEB,通过将大量英文样本从 Massive Text Embedding Benchmark 翻译过来并借助我们新构建的自动化框架实现。我们利用大型语言模型(LLM)和尖端嵌入模型的优势,进行翻译和筛选,以保持语言的自然流畅度和语义忠实度,同时保留命名实体识别(NER)和代码片段。我们的全面基准包括 41 个数据集,来自六个专为越南语文本嵌入设计的任务。我们在分析中发现,使用旋转位置编码(Rotary Positional Embedding)的更大更复杂模型在嵌入任务中优于使用绝对位置编码(Absolute Positional Embedding)的模型。数据集可在 HuggingFace 上获取:https://huggingface.co/collections/GreenNode/vn-mteb-68871433f0f7573b8e1a6686
关键词
引用
@article{arxiv.2507.21500,
title = {VN-MTEB: Vietnamese Massive Text Embedding Benchmark},
author = {Loc Pham and Tung Luu and Thu Vo and Minh Nguyen and Viet Hoang},
journal= {arXiv preprint arXiv:2507.21500},
year = {2025}
}
备注
19 pages (including reference, appendix) 41 datasets from 6 tasks (retrieval, classification, pair-classification, clustering, rerank, sts) 7 figures, 16 tables, benchmark 18 text embedding models