中文

LLM 读茶叶:利用大语言模型自动评估主题模型

计算与语言 2025-01-15 v2

摘要

主题建模一直是无监督文本分析中广泛使用的工具。然而,对主题模型的全面评估仍然具有挑战性。现有的评估方法要么在不同模型之间缺乏可比性(例如,困惑度),要么一次只关注模型的某一个特定方面(例如,主题质量或文档表示质量),这不足以反映模型的整体性能。在本文中,我们提出了 WALM(Word Agreement with Language Model),一种新的主题建模评估方法,该方法利用大语言模型(LLM)的能力,联合考虑文档表示和主题的语义质量。通过涉及不同类型主题模型的广泛实验,WALM 被证明与人类判断一致,可以作为现有评估方法的补充,为主题建模带来新的视角。我们的软件包可在 https://github.com/Xiaohao-Yang/Topic_Model_Evaluation 获取。

关键词

引用

@article{arxiv.2406.09008,
  title  = {LLM Reading Tea Leaves: Automatically Evaluating Topic Models with Large Language Models},
  author = {Xiaohao Yang and He Zhao and Dinh Phung and Wray Buntine and Lan Du},
  journal= {arXiv preprint arXiv:2406.09008},
  year   = {2025}
}

备注

Forthcoming in Transactions of the Association for Computational Linguistics (TACL) published by MIT Press