基于学习目标与基准的越南语信息检索推进研究
信息检索
2025-03-11 v1 人工智能
机器学习
摘要
随着自然语言处理的快速发展,针对多种任务的语言模型层出不穷。信息检索(IR)是一项重要任务,要求模型检索相关文档。尽管该任务在许多现实应用中非常重要,尤其是在检索增强生成(RAG)系统中,但它缺乏越南语基准。这种情况导致难以在信息检索任务上评估和比较许多现有的越南语嵌入语言模型,并减缓了越南语自然语言处理(NLP)研究的进展。在这项工作中,我们旨在为越南语研究社区提供一个用于信息检索的新基准,该基准主要侧重于检索和重排序任务。此外,我们还提出了一个基于InfoNCE损失函数的新目标函数,用于训练我们的越南语嵌入模型。我们的目标函数旨在在信息检索任务中优于原函数。最后,我们分析了温度(两个目标函数中的一个超参数)对文本嵌入模型性能的影响。
引用
@article{arxiv.2503.07470,
title = {Advancing Vietnamese Information Retrieval with Learning Objective and Benchmark},
author = {Phu-Vinh Nguyen and Minh-Nam Tran and Long Nguyen and Dien Dinh},
journal= {arXiv preprint arXiv:2503.07470},
year = {2025}
}