LLM 效应:人类是否真正在使用 LLM,还是被 LLM 所影响?
计算与语言
2024-10-08 v1 人机交互
摘要
大型语言模型(LLM)在各种分析任务中展现出接近人类水平的能力,导致研究人员开始用于耗时耗力的分析任务。然而,它们在诸如政策研究等领域的高度专业化和开放性任务方面的能力仍值得质疑。本文通过结构化的用户研究探讨了 LLM 在专业任务中的效率和准确性,研究重点是人类-LLM 合作。该研究分为两个阶段——主题发现和主题分配——将 LLM 与专家标注员集成,以观察 LLM 建议对通常人类独立分析的影响。结果表明,LLM 生成的主题列表与人类生成的主题列表具有显著的重叠,尽管在遗漏文件特定主题方面存在一些小问题。然而,LLM 的建议可能显著提高任务完成速度,但同时也会引入锚定偏差,可能影响分析的深度和细微差别,这引发了一个关于在提高效率与面临偏差分析风险之间的权衡的关键问题。
引用
@article{arxiv.2410.04699,
title = {The LLM Effect: Are Humans Truly Using LLMs, or Are They Being Influenced By Them Instead?},
author = {Alexander S. Choi and Syeda Sabrina Akter and JP Singh and Antonios Anastasopoulos},
journal= {arXiv preprint arXiv:2410.04699},
year = {2024}
}
备注
Accepted to EMNLP Main 2024. First two authors contributed equally