人类-AI 混合定性研究助手的开发与基准测试
人机交互
2025-12-16 v2 人工智能
摘要
定性研究强调通过与文本数据反复互动来构建意义。传统上,这一以人类为主导的过程需要遍历编码者的疲劳和解释漂移,从而在将分析规模扩展到更大更复杂数据集时提出挑战。旨在增强定性研究的计算方法,往往因无法复制人类分析中所体现的细微差别、情境感知和高级智能而受到怀疑。然而,大型语言模型为在保持严谨和研究质量的同时自动化定性分析的各个方面提供了新的机遇。为评估这些方法的益处与局限性——并在定性研究人员之间建立信任——必须对其进行严格的基准测试,以人类生成的数据集为基准。本文对进行了基准测试的Muse,这是一个交互式、由 AI 驱动的定性研究系统,允许研究人员识别主题并标注数据集,我们发现Muse 与人类之间的主题识别可靠性达到Cohen's = 0.71。我们还进行了稳健的错误分析,以识别失效模式,指导未来改进,展示了纠正人类偏见的能力。
引用
@article{arxiv.2512.00009,
title = {Development and Benchmarking of a Blended Human-AI Qualitative Research Assistant},
author = {Joseph Matveyenko and James Liu and John David Parsons and Ryan A. Brown and Alina Palimaru and Prateek Puri},
journal= {arXiv preprint arXiv:2512.00009},
year = {2025}
}
备注
32 pages, 9 figures