职场中的大语言模型:面向职位类型分类的提示工程案例研究
计算与语言
2023-04-19 v3
摘要
本案例研究调查了真实场景下的职位分类任务,其目标是判断一则英文招聘信息是否适合研究生或入门级职位。我们探索了多种文本分类方法,包括传统模型如支持向量机(SVMs)和前沿深度学习方法如 DeBERTa 等监督方法。我们将它们与用于少样本和零样本分类场景的大语言模型(LLMs)进行比较。为完成该任务,我们采用提示工程——一种通过设计提示来引导 LLMs 产生期望输出的技术。具体而言,我们评估了两个商用前沿的基于 GPT-3.5 的语言模型 text-davinci-003 和 gpt-3.5-turbo 的性能。我们还详细分析了提示工程不同方面对模型性能的影响。结果表明,借助设计良好的提示,零样本 gpt-3.5-turbo 分类器优于所有其他模型,相较最佳监督方法在 95% 召回率下的精确率提升了 6%。此外,我们观察到提示的措辞是引发模型恰当“推理”的关键因素,且提示中看似细微的方面也会显著影响模型性能。
引用
@article{arxiv.2303.07142,
title = {Large Language Models in the Workplace: A Case Study on Prompt Engineering for Job Type Classification},
author = {Benjamin Clavié and Alexandru Ciceu and Frederick Naylor and Guillaume Soulié and Thomas Brightwell},
journal= {arXiv preprint arXiv:2303.07142},
year = {2023}
}
备注
Accepted as a long paper at NLDB 2023