衡量大型语言模型的社会规范
计算与语言
2024-05-24 v4 人工智能
机器学习
摘要
我们提出了一种新挑战,以检验大型语言模型是否理解社会规范。与现有数据集不同,我们的数据集需要对社会规范进行根本性的理解才能解决问题。我们的数据集涵盖最大范围的社会规范技能,包含402项技能和12,383个问题,涵盖从意见、论证到文化和法律等广泛的社会规范。我们按照K-12课程设计数据集,这使我们能够将大型语言模型的社会理解与人类的直接比较,具体而言,是与小学生的理解进行比较。尽管先前的工作在我们的基准上几乎产生随机准确率,但最近的大型语言模型如GPT3.5-Turbo和LLaMA2-Chat能够显著提高性能,仅略低于人类水平。我们随后提出了一种基于大型语言模型的多智能体框架,以提高模型理解社会规范的能力。该方法进一步提升了大型语言模型的能力,使其与人类持平鞣。鉴于大型语言模型在现实世界应用中的日益普及,我们的发现在重要且为未来改进提供了独特方向。
引用
@article{arxiv.2404.02491,
title = {Measuring Social Norms of Large Language Models},
author = {Ye Yuan and Kexin Tang and Jianhao Shen and Ming Zhang and Chenguang Wang},
journal= {arXiv preprint arXiv:2404.02491},
year = {2024}
}