越南句子语义相似大规模基准数据集
计算与语言
2025-02-12 v1
摘要
本文提出了ViSP——一个高质量的越南语句子语义相似数据集,包含120万原始句子与其释义对。该数据集采用混合方法构建,结合自动语义相似生成与人工评估,确保数据质量。我们采用回译、EDA等方法,并实验测试基于BART、T5以及大型语言模型(LLM)如GPT-4o、Gemini-1.5、Aya、Qwen-2.5和Meta-Llama-3.1等模型。据我们所知,这是首个针对越南语语义相似的大规模研究。我们希望本数据集和研究结果将为未来研究及应用提供宝贵基础。
引用
@article{arxiv.2502.07188,
title = {A Large-Scale Benchmark for Vietnamese Sentence Paraphrases},
author = {Sang Quang Nguyen and Kiet Van Nguyen},
journal= {arXiv preprint arXiv:2502.07188},
year = {2025}
}
备注
Accepted in NAACL 2025 Findings