解锁动态文本属性图的多模态潜力——面向链接预测
机器学习
2025-08-04 v2 计算与语言
摘要
动态文本属性图(DyTAGs)是一种新型图范式,捕捉演变中的时间事件(边)以及丰富的文本属性。现有研究可大致分为基于图神经网络的 DyTAG 方法和基于大语言模型的方法,两者都编码文本属性和时间结构以进行 DyTAG 表示。我们观察到 DyTAGs 本质上包含三种不同的模态:时间、文本和结构,往往具有完全不相干的分布。然而,前两种模态在现有研究中被大大忽视,导致性能次优。为此,我们提出 MoMent,一个多模态模型,显式地建模、整合和对齐每个模态,以学习用于链接预测的节点表示。鉴于原始模态分布的不相干性,我们首先构建模态特定特征,并使用各自的编码器来捕捉跨时间模式、语义上下文和局部结构之间的相关性。每个编码器生成模态特定的标记,然后通过理论保证融合为全面的节点表示。为避免这些异构模态的子空间不相干,我们提出双域对齐损失,首先在全局层面对齐分布,然后在实例级别微调一致性。这增强了来自时间、文本和结构三个视角的一致表示。广泛的实验覆盖七个数据集,表明 MoMent 在八个基线方法中实现了最高17.28%的准确率提升和最高31倍的加速。
引用
@article{arxiv.2502.19651,
title = {Unlocking Multi-Modal Potentials for Link Prediction on Dynamic Text-Attributed Graphs},
author = {Yuanyuan Xu and Wenjie Zhang and Ying Zhang and Xuemin Lin and Xiwei Xu},
journal= {arXiv preprint arXiv:2502.19651},
year = {2025}
}