LLM是否理解社会知识?用SocKET基准评估大语言模型的社会性
计算与语言
2024-04-02 v2 人工智能
摘要
大语言模型(LLMs)已被证明在多种句法、话语和推理任务上表现良好。尽管LLMs正以包括与人类交互的对话代理在内的多种形式日益部署,我们仍缺乏一个扎根的基准来衡量LLMs对\textit{社会}语言的理解程度。在此,我们引入一个新的理论驱动基准SocKET,其包含58项测试社会知识的NLP任务,我们将其归为五类:幽默与讽刺、攻击性、情感与情绪,以及可信度。在基准测试中,我们表明当前模型仅达到中等性能,但揭示了不同类型和类别任务间存在由理论预测的任务迁移潜力。通过零样本评估,我们显示预训练模型已具备一些先天但有限的社会语言理解能力,且在一类任务上训练可改善在其他任务上的零样本测试。我们的基准提供了一种系统性分析模型在语言重要维度上表现的方法,并指出构建更具社会感知的LLMs有明显改进空间。相关资源发布于 https://github.com/minjechoi/SOCKET。
引用
@article{arxiv.2305.14938,
title = {Do LLMs Understand Social Knowledge? Evaluating the Sociability of Large Language Models with SocKET Benchmark},
author = {Minje Choi and Jiaxin Pei and Sagar Kumar and Chang Shu and David Jurgens},
journal= {arXiv preprint arXiv:2305.14938},
year = {2024}
}
备注
Camera-ready version for EMNLP'23. First two authors contributed equally