GuARD:面向文本丰富图的有效异常检测模型
计算与语言
2025-08-08 v2 人工智能
摘要
文本丰富图的异常检测在现实场景中广泛存在,如检测学术论文错误分配给作者或检测社交网络中的机器人。大型语言模型(LLM)的卓越能力为利用丰富文本信息进行有效异常检测开辟了新路径。然而,仅简单地将丰富文本引入 LLM 可能会模糊关键检测线索,并引入高昂的微调成本。此外,LLM 常常忽视图结构固有的偏差,这对于区分正常与异常节点模式至关重要。为此,本文引入 GuARD,一个结合图基方法关键结构特征和通过小型语言模型提取的细粒度语义属性的文本丰富且图信息驱动的语言模型,以实现对文本丰富图的有效异常检测。GuARD 在以任务导向的指令微调框架中进行渐进式多模态多轮指令调优,以适配丰富文本和结构模态。四个数据集上的大量实验表明,GuARD 在图基和 LLM 基异常检测方法上均表现优异,同时在大规模 WhoIsWho 数据集上相较于 vanilla 长上下文 LLM 在训练和推理上分别实现约 5 倍的加速。
引用
@article{arxiv.2412.03930,
title = {GuARD: Effective Anomaly Detection through a Text-Rich and Graph-Informed Language Model},
author = {Yunhe Pang and Bo Chen and Fanjin Zhang and Yanghui Rao and Evgeny Kharlamov and Jie Tang},
journal= {arXiv preprint arXiv:2412.03930},
year = {2025}
}
备注
Accepted at KDD 2025