只要放一个人在循环里?探究 LLM 辅助标注在主观任务中的作用
计算机与社会
2025-07-22 v1
摘要
LLM 在标注领域的应用日益广泛,鉴于 LLM 总体上表现出色且速度快,仅仅“审查” LLM 生成的标注在解释性任务中显得有诱惑力。在多个合理答案的主观标注任务中,审查 LLM 输出会改变标签分布,从而影响 LLM 性能的评估,以及这些标签在下游社会科学任务中的分析。我们进行了一次预先登记的实验,使用 410 位独特标注者和超过 7000 条标注,测试三个 AI 辅助条件对照组,使用两个模型和两个数据集。我们发现,向众包工作者呈现 LLM 生成的标注建议并不使他们更快,但确实提高了他们对任务的自报告信心。更重要的是,标注者强烈接受了 LLM 的建议,显著改变了与基线相比的标签分布。当这些带有 LLM 辅助的标签用于评估 LLM 性能时,报告的模型性能显著增加。我们认为我们的工作阐明了 LLM 辅助标注对主观、定性任务、用于训练和测试的黄金数据的创建,以及对 NLP 系统在主观任务上的评估的重要性。
引用
@article{arxiv.2507.15821,
title = {Just Put a Human in the Loop? Investigating LLM-Assisted Annotation for Subjective Tasks},
author = {Hope Schroeder and Deb Roy and Jad Kabbara},
journal= {arXiv preprint arXiv:2507.15821},
year = {2025}
}