中文

提示设计对计算社会科学任务的影响——但以不可预测的方式

人工智能 2025-06-30 v1 计算机与社会

摘要

手动为计算社会科学任务标注数据可能是昂贵的、耗时的且在情感上疲劳的。虽然最近的工作表明大语言模型(LLM)可以在零样本设置下执行此类标注任务,但关于提示设计如何影响 LLM 合规性和准确性的了解仍很少。我们进行了大规模的多提示实验,以测试模型选择(ChatGPT、PaLM2 和 Falcon7b)和提示设计特征(定义包含、输出类型、解释和提示长度)对 LLM 生成标注合规性和准确性的影响,涉及四个计算社会科学任务(毒性、情感、谣言立场和新闻框架)。我们的结果表明,LLM 的合规性和准确性高度依赖于提示。例如,要求给出数值分数而非标签会降低所有 LLM 的合规性和准确性。总体而言,最佳提示设置取决于任务,微小的提示变化可能导致生成标签分布的大幅变化。通过表明提示设计显著影响 LLM 生成标注的质量和分布,这项工作既是警示,也是为研究人员和实践者提供实用指南。

关键词

引用

@article{arxiv.2406.11980,
  title  = {Prompt Design Matters for Computational Social Science Tasks but in Unpredictable Ways},
  author = {Shubham Atreja and Joshua Ashkinaze and Lingyao Li and Julia Mendelsohn and Libby Hemphill},
  journal= {arXiv preprint arXiv:2406.11980},
  year   = {2025}
}

备注

under review