利用大语言模型大规模收集定性数据:一项案例研究
人机交互
2024-12-05 v3
摘要
聊天机器人已显示出作为扩展定性数据收集工具的潜力。大语言模型(LLMs)的最新进展可通过让研究者轻松部署复杂访谈聊天机器人来加速这一过程。我们通过开展一项大规模用户研究(n=399)来检验该假设,评估了 3 种不同的聊天机器人,其中两个基于 LLM,一个采用硬编码问题的基线。我们依据参与者参与度与体验、基于有效沟通理论的既定聊天机器人质量指标,以及一种评估“丰富度”(即响应捕获所研究社会背景复杂性与具体性的程度)的新量表评估结果。我们发现,尽管基于既定评价指标聊天机器人能够引出高质量响应,但这些响应很少捕获参与者的具体动机或个性化例子,因此在丰富度方面表现不佳。我们进一步发现 LLM 与人类在质量和丰富度指标评估上的一致性信度较低。我们的研究为利用 LLM 扩展和评估定性研究提供了警示。
引用
@article{arxiv.2309.10187,
title = {Collecting Qualitative Data at Scale with Large Language Models: A Case Study},
author = {Alejandro Cuevas and Jennifer V. Scurrell and Eva M. Brown and Jason Entenmann and Madeleine I. G. Daepp},
journal= {arXiv preprint arXiv:2309.10187},
year = {2024}
}
备注
27 pages, 6 figures