中文

人类与基于大语言模型的主题分析在数字心理健康研究中的比较:概念验证比较研究

人机交互 2025-07-14 v1 人工智能

摘要

主题分析通过编码和主题开发提供有价值的对参与者体验的洞察,但其资源密集型的特性限制了其在大型医疗保健研究中的应用。大语言模型(LLM)能够按比例分析文本并自动识别关键内容,从而可能缓解这些挑战。然而,其在精神健康访谈中的应用需要与传统人类分析进行比较。本研究评估了即插即用和基于知识库的LLM主题分析方法,针对来自减压试验中医护人员的访谈记录进行传统方法的比较。使用OpenAI的GPT-4o模型,结合角色、指令、步骤、终点目标、缩小(RISEN)提示工程框架进行比较,方法包括在Dedoose中的人类分析。每种方法开发代码、记录饱和点、将代码应用到20名参与者的片段,并综合数据形成主题。比较了输出和绩效指标。使用RISEN框架的LLM开发了与人类代码相似的演绎性父代码,但人类在归纳性子代码开发和主题综合方面表现更佳。基于知识的LLM在编码饱和时所需的访谈记录(10-15)少于即插即用模型(15-20)和人类(90-99)。即插即用LLM识别的片段数量与人类研究者相当,显示出强大的跨评估可靠性(K=0.84),尽管基于知识的LLM产生的片段较少。人类片段较长且涉及多个代码,而LLM通常只应用一个代码。总体而言,LLM主题分析更具成本效益,但缺乏人类分析的深度。当结合人类监督在平衡参与者视角和研究资源方面时,LLM可以 transform 精神医疗和临床研究中的定性分析。

关键词

引用

@article{arxiv.2507.08002,
  title  = {Human vs. LLM-Based Thematic Analysis for Digital Mental Health Research: Proof-of-Concept Comparative Study},
  author = {Karisa Parkington and Bazen G. Teferra and Marianne Rouleau-Tang and Argyrios Perivolaris and Alice Rueda and Adam Dubrowski and Bill Kapralos and Reza Samavi and Andrew Greenshaw and Yanbo Zhang and Bo Cao and Yuqi Wu and Sirisha Rambhatla and Sridhar Krishnan and Venkat Bhat},
  journal= {arXiv preprint arXiv:2507.08002},
  year   = {2025}
}