T-VEC:基于深度三角损失微调的面向电信领域的向量化模型
计算与语言
2025-10-10 v2 人工智能
摘要
电信行业的专有词汇和细微概念始终是标准自然语言处理(NLP)模型面临的挑战。通用嵌入模型常常难以准确表示电信领域的语义,限制了其在检索和下游任务中的实用性。我们提出了T-VEC(Telecom Vectorization Model),这是一款基于gte-Qwen2-1.5B-instruct backbone微调的领域适应嵌入模型,采用三角损失目标进行微调。微调使用了T-Embed数据集,该数据集覆盖了多样化的电信概念、标准和运营场景,具有高质量和大规模。虽然T-Embed包含部分专有材料,无法完全公开,但我们开源了数据集的75%以支持领域特定表示学习的持续研究。在一个由IETF RFC和厂商手册组成的自定义基准测试中包含1500个查询-段落对的基准测试中,T-VEC超过了MPNet、BGE、Jina和E5,展示了在电信领域检索中的卓越的领域 grounding能力和语义精确度。嵌入可视化进一步展示了电信相关概念的紧密聚类。我们发布T-VEC及其分词器,以支持电信领域内语义忠实的NLP应用。
关键词
引用
@article{arxiv.2504.16460,
title = {T-VEC: A Telecom-Specific Vectorization Model with Enhanced Semantic Understanding via Deep Triplet Loss Fine-Tuning},
author = {Vignesh Ethiraj and Ashwath David and Sidhanth Menon and Divya Vijay and Vidhyakshaya Kannan},
journal= {arXiv preprint arXiv:2504.16460},
year = {2025}
}
备注
Accepted to EMNLP 2025 (Industry Track)