中文

ViCLSR:基于自然语言推理的监督式对比学习框架用于自然语言理解任务

计算与语言 2026-03-24 v1 人工智能 机器学习

摘要

高质量的文本表示对自然语言理解 (NLU) 至关重要,但低资源语言如越南语面临数据有限的挑战。虽然预训练模型如 PhoBERT 和 CafeBERT 表现良好,但其效果受限于数据匮乏。对比学习 (CL) 近期作为提高句子表示的有前景的方法,使模型能够有效区分语义相似与不相似的句子。我们提出了 ViCLSR(越南语对比学习 for 句子表示),一个专为优化越南语句子嵌入而设计的新型监督式对比学习框架,利用现有的自然语言推理 (NLI) 数据集。此外,我们提出了一种过程来适配现有的越南语数据集进行监督式学习,确保与对比学习方法的兼容性。我们的实验表明,ViCLSR 在五个基准 NLU 数据集上显著优于强大的单语预训练模型 PhoBERT,例如 ViNLI (+6.97% F1)、ViWikiFC (+4.97% F1)、ViFactCheck (+9.02% F1)、UIT-ViCTSD (+5.36% F1) 和 ViMMRC2.0 (+4.33% Accuracy)。ViCLSR 显示出监督式对比学习能够有效解决越南语 NLU 任务中的资源限制问题,并提高低资源语言的句子表示学习。此外,我们对实验结果进行深入分析,以揭示对比学习模型卓越性能的影响因素。ViCLSR 将为推进自然语言处理任务的研究提供发布。

关键词

引用

@article{arxiv.2603.21084,
  title  = {ViCLSR: A Supervised Contrastive Learning Framework with Natural Language Inference for Natural Language Understanding Tasks},
  author = {Tin Van Huynh and Kiet Van Nguyen and Ngan Luu-Thuy Nguyen},
  journal= {arXiv preprint arXiv:2603.21084},
  year   = {2026}
}