中文

ViConBERT:面向多义词和语义感知的越南语上下文- gloss 对齐词嵌入

计算与语言 2025-11-18 v1

摘要

近期的上下文化词嵌入技术大幅提升了词义消歧 (WSD) 和上下文相似性等语义任务的性能,但大多数进展仅限于高资源语言如英语。相比之下,越南语仍缺乏用于细粒度语义理解的鲁棒模型和评估资源。在本文中,我们提出了 ViConBERT,一种用于学习越南语上下文化词嵌入的新框架,集成对比学习 (SimCLR) 和 gloss 基 distillation,以更好地捕捉词义。我们还引入了 ViConWSD,即第一个大规模合成数据集,用于评估越南语的语义理解,涵盖 WSD 和上下文相似性两个任务。实验结果表明,ViConBERT 在 WSD 上取得 F1 = 0.87 的优异成绩,并在 ViCon (AP = 0.88) 和 ViSim-400 (Spearman's rho = 0.60) 上实现竞争性能,证明其在建模离散语义sense和 graded 语义关系方面的有效性。我们的代码、模型和数据已在 https://github.com/tkhangg0910/ViConBERT 上提供。

关键词

引用

@article{arxiv.2511.12249,
  title  = {ViConBERT: Context-Gloss Aligned Vietnamese Word Embedding for Polysemous and Sense-Aware Representations},
  author = {Khang T. Huynh and Dung H. Nguyen and Binh T. Nguyen},
  journal= {arXiv preprint arXiv:2511.12249},
  year   = {2025}
}