黑中求解:在无金标情况下的人类提示工程数据标注性能评估
人机交互
2025-09-03 v1 人工智能
计算与语言
机器学习
摘要
数以百万计的用户为各种任务调用大语言模型(LLM),但这些人到底在提示工程方面有多好?在多个提示迭代后,用户是否真的接近了他们希望的结果?这些问题在没有可用的金标准标签来衡量进展时尤为关键。本文考察了一种 LLM 驱动的数据标注场景,即“黑中求解”,用户在没有使用手动标注基准的情况下,对 LLM 进行迭代提示以完成数据标注。我们开发了 PromptingSheet,这是一个集成在 Google 表格中的插件,使用户能够通过表格编写、修订和迭代标注数据。在与 20 名参与者进行的研究中发现,黑中求解极不可靠——只有 9 名参与者在四个或更多迭代后提高了标注准确率。当金标签稀少时,像 DSPy 这样的自动化提示优化工具也难以发挥作用。我们的发现凸显了金标签的重要性以及自动化支持在人类提示工程中所需和潜在风险,为未来的工具设计提供了启示。
引用
@article{arxiv.2502.11267,
title = {Prompting in the Dark: Assessing Human Performance in Prompt Engineering for Data Labeling When Gold Labels Are Absent},
author = {Zeyu He and Saniya Naphade and Ting-Hao 'Kenneth' Huang},
journal= {arXiv preprint arXiv:2502.11267},
year = {2025}
}
备注
Accepted By CHI 2025