评估即所需:利用开源生成式大语言模型进行社会科学标注任务入门
计算与语言
2024-01-02 v1
摘要
本文探讨了在社会科学标注任务中使用开源生成式大语言模型(LLMs)。研究强调了专有模型相关的挑战,如可复现性有限和隐私担忧,并倡导采用可在独立设备上运行的开源模型。文中提供了两个标注任务示例:推文情感分析和儿童励志作文中的休闲活动识别。研究评估了不同提示策略和模型(neural-chat-7b-v3-2、Starling-LM-7B-alpha、openchat_3.5、zephyr-7b-alpha 和 zephyr-7b-beta)的性能。结果表明需要进行仔细的验证和定制的提示工程。研究突出了开源模型在数据隐私和可复现性方面的优势。
引用
@article{arxiv.2401.00284,
title = {Evaluation is all you need. Prompting Generative Large Language Models for Annotation Tasks in the Social Sciences. A Primer using Open Models},
author = {Maximilian Weber and Merle Reichardt},
journal= {arXiv preprint arXiv:2401.00284},
year = {2024}
}