提示设计对计算社会科学任务的影响——但以不可预测的方式
人工智能
2025-06-30 v1 计算机与社会
摘要
手动为计算社会科学任务标注数据可能是昂贵的、耗时的且在情感上疲劳的。虽然最近的工作表明大语言模型(LLM)可以在零样本设置下执行此类标注任务,但关于提示设计如何影响 LLM 合规性和准确性的了解仍很少。我们进行了大规模的多提示实验,以测试模型选择(ChatGPT、PaLM2 和 Falcon7b)和提示设计特征(定义包含、输出类型、解释和提示长度)对 LLM 生成标注合规性和准确性的影响,涉及四个计算社会科学任务(毒性、情感、谣言立场和新闻框架)。我们的结果表明,LLM 的合规性和准确性高度依赖于提示。例如,要求给出数值分数而非标签会降低所有 LLM 的合规性和准确性。总体而言,最佳提示设置取决于任务,微小的提示变化可能导致生成标签分布的大幅变化。通过表明提示设计显著影响 LLM 生成标注的质量和分布,这项工作既是警示,也是为研究人员和实践者提供实用指南。
引用
@article{arxiv.2406.11980,
title = {Prompt Design Matters for Computational Social Science Tasks but in Unpredictable Ways},
author = {Shubham Atreja and Joshua Ashkinaze and Lingyao Li and Julia Mendelsohn and Libby Hemphill},
journal= {arXiv preprint arXiv:2406.11980},
year = {2025}
}
备注
under review