中文

评估大型语言模型在越南语言事实核查数据生成中的能力

计算与语言 2024-11-11 v1

摘要

大型语言模型(LLM)凭借不断提升的阅读理解和推理能力,正在被应用于各类复杂语言任务,包括为各种目的自动生成语言数据的任务。然而,针对越南语言等低资源语言使用 LLM 进行自动数据生成的研究仍不成熟,缺乏全面的评估。本文探索了使用 LLM 为越南语言事实核查任务自动生成数据的可能性,该任务面临显著的数据限制。具体而言,我们聚焦于事实核查数据,其中主张是从多个证据句子中综合合成而来,以评估 LLM 的信息综合能力。我们开发了基于简单提示技术的 LLM 自动数据构建流程,并探索了多种方法以提高生成数据的质量。为评估 LLM 生成数据的质量,我们进行了人工质量评估和使用语言模型的性能评估。实验结果和人工评估表明,尽管通过微调技术显著提升了生成数据的质量,但 LLM 仍无法与人类生成的数据质量相匹配。

关键词

引用

@article{arxiv.2411.05641,
  title  = {Evaluating Large Language Model Capability in Vietnamese Fact-Checking Data Generation},
  author = {Long Truong To and Hung Tuan Le and Dat Van-Thanh Nguyen and Manh Trong Nguyen and Tri Thien Nguyen and Tin Van Huynh and Kiet Van Nguyen},
  journal= {arXiv preprint arXiv:2411.05641},
  year   = {2024}
}