FLeW:科学文献的层面级自适应加权表示学习
信息检索
2025-09-10 v1 人工智能
摘要
科学文献表示学习为各种任务提供了强大的嵌入向量,然而当前方法在三种途径上面临挑战。1)利用引用结构信号进行对比训练的方法未能充分利用引用信息,且仍生成单向量表示。2)在句子或层面级别生成多向量的细粒度表示学习需要昂贵的整合成本,并且缺乏领域泛化能力。3)任务感知学习依赖于人工预定义的任务分类,忽略了细微的任务差异,并需要额外的训练数据来训练任务特定模块。为了解决这些问题,我们提出了一种统一这三种方法以获得更好表示的新方法,即FLeW。具体来说,我们引入了一种新颖的三元组采样方法,利用引用意图和频率来增强用于训练的引用结构信号。引用意图(背景、方法、结果)与科学写作的一般结构对齐,为细粒度表示学习提供了领域泛化的层面划分。然后,我们采用简单的权重搜索,自适应地将三个层面级嵌入整合为任务特定的文档嵌入,而无需进行任务感知的微调。实验表明,与先前模型相比,FLeW在多个科学任务和领域上具有适用性和鲁棒性。
引用
@article{arxiv.2509.07531,
title = {FLeW: Facet-Level and Adaptive Weighted Representation Learning of Scientific Documents},
author = {Zheng Dou and Deqing Wang and Fuzhen Zhuang and Jian Ren and Yanlin Hu},
journal= {arXiv preprint arXiv:2509.07531},
year = {2025}
}
备注
Accepted by DASFAA2025