基于大语言模型与图结构理解细粒度合成流式数据以应对数据稀疏性
计算与语言
2024-03-12 v1 人工智能
摘要
由于用户数据的稀疏性,电子商务平台上对用户评论的情感分析往往表现不佳,尤其是在面对极度稀疏的用户数据或长尾标签时。最近,大语言模型 (LLM) 的出现通过利用图结构生成补充用户画像,为此类问题引入了新的解决方案。然而,先前的方法尚未充分利用 LLM 的图理解能力,并且难以适应复杂的流式数据环境。在这项工作中,我们提出了一种细粒度的流式数据合成框架,将稀疏用户分为三类:中尾、长尾和极端稀疏。具体而言,我们设计 LLM 以全面理解流式数据中的三个关键图元素,包括局部 - 全局图理解、二阶关系提取和产品属性理解,这使得能够生成高质量的合成数据,以有效解决不同类别的稀疏性问题。在三个真实数据集上的实验结果证明了显著的性能提升,合成数据分别贡献了 45.85%、3.16% 和 62.21% 的均方误差 (MSE) 降低。
引用
@article{arxiv.2403.06139,
title = {Fine-grainedly Synthesize Streaming Data Based On Large Language Models With Graph Structure Understanding For Data Sparsity},
author = {Xin Zhang and Linhai Zhang and Deyu Zhou and Guoqiang Xu},
journal= {arXiv preprint arXiv:2403.06139},
year = {2024}
}