零样本分类中的提示复杂度探究:计算社会科学领域大语言模型研究
计算与语言
2024-03-26 v3
摘要
指令微调大语言模型(LLM)已展现出令人印象深刻的语义理解能力以及生成遵循特定提示的回复的能力。然而,由于训练这些模型所需的计算资源庞大,其应用常采用零样本设定。本文中,我们在六项计算社会科学分类任务背景下评估了两个公开可用 LLM(ChatGPT 与 OpenAssistant)的零样本性能,同时考察了多种提示策略的影响。我们的实验探究了提示复杂度的影响,包括将标签定义纳入提示的效果、使用标签名的同义词,以及基础模型训练期间整合过往记忆的影响。研究结果表明,在零样本设定下,当前 LLM 无法匹敌更小的微调基线 transformer 模型(如 BERT-large)的性能。此外,我们发现不同的提示策略会显著影响分类准确率,准确率与 F1 分数的差异超过 10%。
引用
@article{arxiv.2305.14310,
title = {Navigating Prompt Complexity for Zero-Shot Classification: A Study of Large Language Models in Computational Social Science},
author = {Yida Mu and Ben P. Wu and William Thorne and Ambrose Robinson and Nikolaos Aletras and Carolina Scarton and Kalina Bontcheva and Xingyi Song},
journal= {arXiv preprint arXiv:2305.14310},
year = {2024}
}
备注
Accepted at LREC-COLING 2024