中文

KorNAT:面向韩国社会价值观与常识的大语言模型对齐基准

计算与语言 2024-06-14 v6

摘要

为了使大语言模型(LLMs)在特定国家有效部署,它们必须理解该国的文化和基本知识。为此,我们引入了国家对齐(National Alignment),它从两个方面衡量LLM与目标国家之间的对齐:社会价值观对齐和常识对齐。社会价值观对齐评估模型理解国家特定社会价值观的程度,而常识对齐则考察模型掌握与国家相关的基本知识的程度。我们构建了KorNAT,这是首个衡量与韩国国家对齐的基准。对于社会价值观数据集,我们从一项涉及6174名韩国参与者的大规模调查中获得了基准真值标签。对于常识数据集,我们基于韩国教科书和GED参考材料构建了样本。KorNAT分别包含4000道和6000道关于社会价值观和常识的多选题。我们的数据集创建过程经过精心设计,基于统计抽样理论,并通过多轮人工审核进行完善。七个LLM的实验结果表明,只有少数模型达到了我们的参考分数,表明仍有进一步提升的空间。KorNAT已通过一家致力于评估数据集质量的政府附属机构的评估,并获得政府批准。数据集的样本和详细评估协议可在https://huggingface.co/datasets/jiyounglee0523/KorNAT 找到。

关键词

引用

@article{arxiv.2402.13605,
  title  = {KorNAT: LLM Alignment Benchmark for Korean Social Values and Common Knowledge},
  author = {Jiyoung Lee and Minwoo Kim and Seungho Kim and Junghwan Kim and Seunghyun Won and Hwaran Lee and Edward Choi},
  journal= {arXiv preprint arXiv:2402.13605},
  year   = {2024}
}

备注

Accepted at ACL 2024 Findings (35 pages, 7 figures, 16 tables)