中文

评估大语言模型在越南通识教育选择题中的符号绑定能力

计算与语言 2025-05-14 v5

摘要

本文中,我们评估大语言模型(LLMs)在零样本、单样本和少样本设定下执行多选符号绑定(MCSB)以进行多选问答(MCQA)任务的能力。我们聚焦越南语,其具挑战性的 MCQA 数据集比英语少。两个现有数据集 ViMMRC 1.0 和 ViMMRC 2.0 聚焦文学。越南自然语言处理(NLP)近期研究聚焦 2019 至 2023 年越南国家高中毕业考试(VNHSGE)以评估 ChatGPT。然而,这些研究主要关注 ChatGPT 如何逐步求解 VNHSGE。我们旨在通过为数学、物理、化学和生物的 LaTeX 公式录入提供结构化指南,创建一个新颖且高质量的数据集。该数据集可用于评估 LLMs 和较小语言模型(LMs)的 MCSB 能力,因其以严格 LaTeX 风格录入。我们聚焦在给定问题语境下预测最可能为答案的字符(A、B、C 或 D)。我们对六个知名 LLMs(即 BLOOMZ-7.1B-MT、LLaMA-2-7B、LLaMA-2-70B、GPT-3、GPT-3.5 和 GPT-4.0)在 ViMMRC 1.0、ViMMRC 2.0 基准及我们提出的数据集上的评估,显示了 LLMs 在越南语 MCSB 能力上的有前景结果。该数据集仅限研究用途。

关键词

引用

@article{arxiv.2310.12059,
  title  = {Evaluating the Symbol Binding Ability of Large Language Models for Multiple-Choice Questions in Vietnamese General Education},
  author = {Duc-Vu Nguyen and Quoc-Nam Nguyen},
  journal= {arXiv preprint arXiv:2310.12059},
  year   = {2025}
}

备注

Accepted at SoICT 2023