基于大语言模型的舆情事件热度预测研究
计算与语言
2024-09-30 v1 人工智能
摘要
近年来,随着大语言模型的快速发展,GPT-4o 等多个模型展现出了非凡的能力,在各种语言任务中超越了人类的表现。因此,许多研究人员开始探索其在舆情分析领域的潜在应用。本研究提出了一种基于大语言模型的舆情事件热度预测新方法。首先,我们对 2022 年 7 月至 2023 年 12 月期间收集的 62,836 条中文热点事件数据进行了预处理和分类。然后,基于每个事件的网络传播热度指数,我们使用 MiniBatchKMeans 算法对事件进行自动聚类,并将其划分为四个热度等级(从低热度到极高热度)。接下来,我们从每个热度等级中随机选取 250 个事件,共计 1,000 个事件,以构建评估数据集。在评估过程中,我们采用了多种大语言模型来评估它们在两种场景下预测事件热度的准确性:无参考案例场景和有相似案例参考场景。结果显示,GPT-4o 和 DeepseekV2 在后一种场景中表现最佳,预测准确率分别达到 41.4% 和 41.5%。尽管整体预测准确率仍然相对较低,但值得注意的是,对于低热度(1 级)事件,这两个模型的预测准确率分别达到了 73.6% 和 70.4%。此外,预测准确率从 1 级到 4 级呈下降趋势,这与实际数据集中各热度等级数据分布不均有关。这表明,拥有更稳健的数据集,基于大语言模型的舆情事件热度预测在未来将具有巨大的研究潜力。
引用
@article{arxiv.2409.18548,
title = {Research on Predicting Public Opinion Event Heat Levels Based on Large Language Models},
author = {Yi Ren and Tianyi Zhang and Weibin Li and DuoMu Zhou and Chenhao Qin and FangCheng Dong},
journal= {arXiv preprint arXiv:2409.18548},
year = {2024}
}
备注
conference