中文

词云作为共同声音:基于大语言模型辅助的定性访谈参与者加权主题可视化

计算与语言 2025-08-12 v1 人工智能 人机交互

摘要

词云是总结定性访谈的常用方法,但传统的基于词频的方法在对话语境中往往失效:它们会凸显填充词、忽略同义转述,并割裂语义相关的观点。这限制了它们在早期分析阶段的实用性,此时研究人员需要快速、可解释的概览来了解参与者实际说了什么。我们推出了 ThemeClouds,一个开源可视化工具,它利用大语言模型(LLMs)从对话转录稿中生成主题性的、按参与者加权的词云。该系统提示大语言模型识别整个语料库中的概念级主题,然后统计有多少位独立参与者提及了每个话题,从而生成一种基于提及广度而非原始词频的可视化结果。研究人员可以自定义提示词和可视化参数,从而提供透明度和控制力。利用一项比较五种录音设备配置的用户研究中的访谈(31 名参与者;155 份转录稿,使用 Whisper ASR),我们的方法比频率词云和主题建模基线(例如 LDA、BERTopic)揭示了更多可操作的设备问题。我们讨论了将大语言模型辅助整合到定性工作流中的设计权衡、对可解释性和研究者能动性的影响,以及进行交互式分析(如按条件对比的“差异云”)的机会。

关键词

引用

@article{arxiv.2508.07517,
  title  = {Word Clouds as Common Voices: LLM-Assisted Visualization of Participant-Weighted Themes in Qualitative Interviews},
  author = {Joseph T. Colonel and Baihan Lin},
  journal= {arXiv preprint arXiv:2508.07517},
  year   = {2025}
}