基于框架的大语言模型自由回答定性分析:算法保真度
计算与语言
2024-02-06 v3 人工智能
摘要
如今,利用大规模生成式语言模型(LLM)可模拟对访谈问题的自由回答,这类回答传统上由定性研究方法分析。定性方法论涵盖广泛的技术族,涉及对以自然语言自由进行的开放式访谈或对话的手动分析。此处我们考量由 LLM 生成的人工“硅被试”是否可被富有成效地用定性方法研究,以产生可推广至真实人类群体的洞见。我们分析中的关键概念是算法保真度(algorithmic fidelity),该术语由 Argyle 等人(2023)提出,刻画 LLM 生成输出反映人类子群体信念与态度的程度。依定义,高算法保真度意味着从 LLM 引出的潜在信念可推广至真实人类,而低算法保真度使此类研究无效。此处我们使用 LLM 生成与一组人类被试一一对应的、具特定人口统计学特征的硅被试访谈。利用基于框架的定性分析,我们显示从人类与硅被试得到的关键主题惊人地相似。然而,当我们分析访谈的结构与语气时,发现了更为惊人的差异。我们也发现了 Aher 等人(2023)描述的超准确失真证据。我们得出结论:所测 LLM(GPT-3.5)不具备足够的算法保真度以期望对其研究可推广至人类群体。但 LLM 研究的快速步伐使未来改变成为可能。因此我们强调,当下亟需围绕如何评估基于 LLM 的定性研究有效性建立认知规范,尤其关乎确保异质生活经验代表性的需要。
引用
@article{arxiv.2309.06364,
title = {Framework-Based Qualitative Analysis of Free Responses of Large Language Models: Algorithmic Fidelity},
author = {Aliya Amirova and Theodora Fteropoulli and Nafiso Ahmed and Martin R. Cowie and Joel Z. Leibo},
journal= {arXiv preprint arXiv:2309.06364},
year = {2024}
}
备注
52 pages, 5 tables, 5 figures