中文

超越黑箱:在基于 BERTopic 的量化话语分析中整合词汇与语义方法

计算与语言 2025-08-27 v1

摘要

随着大语言模型和计算工具的兴起,量化话语分析(QDA)得到越来越广泛的应用。然而,对 MAXQDA 和 NVivo 等黑箱软件的依赖可能会破坏方法论的透明度和与研究目标的一致性。本文提出了一个用于 QDA 的混合、透明框架,该框架结合了词汇和语义方法,以实现三角验证、可复现性和可解释性。借鉴一个历史政治话语的案例研究,我们展示了使用 NLTK、spaCy 和 Sentence Transformers 的自定义 Python 流水线如何实现对预处理、词形还原和嵌入生成的细粒度控制。我们进一步详细介绍了我们的迭代式 BERTopic 建模过程,该过程结合了 UMAP 降维、HDBSCAN 聚类和 c-TF-IDF 关键词提取,并通过参数调优和多次运行进行优化,以增强主题的连贯性和覆盖率。通过将精确的词汇搜索与上下文感知的语义聚类并置,我们主张采用一种多层方法,以减轻单独使用任何一种方法的局限性。我们的工作流程强调了代码级透明度、研究者能动性和方法论三角验证在计算话语研究中的重要性。代码和补充材料可通过 GitHub 获取。

关键词

引用

@article{arxiv.2508.19099,
  title  = {Beyond the Black Box: Integrating Lexical and Semantic Methods in Quantitative Discourse Analysis with BERTopic},
  author = {Thomas Compton},
  journal= {arXiv preprint arXiv:2508.19099},
  year   = {2025}
}

备注

5 pages conference paper, 4 tables