LLM 读茶叶:利用大语言模型自动评估主题模型
计算与语言
2025-01-15 v2
摘要
主题建模一直是无监督文本分析中广泛使用的工具。然而,对主题模型的全面评估仍然具有挑战性。现有的评估方法要么在不同模型之间缺乏可比性(例如,困惑度),要么一次只关注模型的某一个特定方面(例如,主题质量或文档表示质量),这不足以反映模型的整体性能。在本文中,我们提出了 WALM(Word Agreement with Language Model),一种新的主题建模评估方法,该方法利用大语言模型(LLM)的能力,联合考虑文档表示和主题的语义质量。通过涉及不同类型主题模型的广泛实验,WALM 被证明与人类判断一致,可以作为现有评估方法的补充,为主题建模带来新的视角。我们的软件包可在 https://github.com/Xiaohao-Yang/Topic_Model_Evaluation 获取。
引用
@article{arxiv.2406.09008,
title = {LLM Reading Tea Leaves: Automatically Evaluating Topic Models with Large Language Models},
author = {Xiaohao Yang and He Zhao and Dinh Phung and Wray Buntine and Lan Du},
journal= {arXiv preprint arXiv:2406.09008},
year = {2025}
}
备注
Forthcoming in Transactions of the Association for Computational Linguistics (TACL) published by MIT Press