GORAG:基于图的在线检索增强生成用于动态少样本社交媒体文本分类
计算与语言
2026-01-30 v4 信息检索
机器学习
摘要
文本分类对于Web for Good应用(如仇恨言论和错误信息检测)至关重要。然而,传统模型(如BERT)在动态少样本设置中常常失败,因为标注数据稀缺且目标标签频繁演变。虽然大型语言模型(LLM)在少样本设置中显示出潜力,但在动态演变场景中,其性能常因输入规模增大而受到阻碍。为解决这些问题,我们提出了GORAG,一种基于图的在线检索增强生成框架,用于动态少样本文本分类。GORAG构建并维护一个关键词和文本标签的加权图,将它们的相关性表示为边。为了建模这些相关性,GORAG采用边加权机制来优先考虑提取信息的重要性和可靠性,并针对每个输入使用定制的最小成本生成树动态检索相关上下文。实证评估表明,GORAG通过提供更全面和精确的上下文信息,优于现有方法。我们的代码已发布在:https://github.com/Wyb0627/GORAG。
引用
@article{arxiv.2501.02844,
title = {GORAG: Graph-based Online Retrieval Augmented Generation for Dynamic Few-shot Social Media Text Classification},
author = {Yubo Wang and Haoyang Li and Fei Teng and Lei Chen},
journal= {arXiv preprint arXiv:2501.02844},
year = {2026}
}
备注
Accepted by WWW 2026