中文

HICode:基于大语言模型的层次性归纳编码

计算与语言 2025-09-23 v1 人工智能 人机交互

摘要

尽管大量应用用于精细语料库分析,但研究者仍依赖手动标注,这种做法难以扩展,或使用难以控制的统计工具如主题建模。我们提出大语言模型 (LLM) 有望将研究者通常在手动分析中进行的细粒度分析扩展到大规模文本语料库。为此,灵感来自定性研究方法,我们开发了 HICode,一个由两部分组成的管道,首先从分析数据中直接归纳生成标签,然后层次化地对其进行聚类,以发现新兴主题。我们通过衡量与人类构建主题的对齐度,并通过自动和人类评估展示其鲁棒性来验证这一方法。最后,我们进行了一项诉讼文件案例研究,涉及美国正在进行的阿司匹林危机相关文件,揭示了制药公司所采取的激进营销策略,展示了 HICode 在大规模数据中促进细粒度分析的潜力。

关键词

引用

@article{arxiv.2509.17946,
  title  = {HICode: Hierarchical Inductive Coding with LLMs},
  author = {Mian Zhong and Pristina Wang and Anjalie Field},
  journal= {arXiv preprint arXiv:2509.17946},
  year   = {2025}
}

备注

Long paper accepted at EMNLP 2025 main conference, 19 pages, 8 figures