中文

TRN-R1-Zero:基于强化学习的文本丰富网络推理

计算与语言 2026-04-22 v1 机器学习

摘要

零样本推理文本丰富网络(TRN)仍是一个具有挑战性的前沿问题,因为模型必须在没有任务特定监督的情况下,将文本语义与关系结构集成。虽然图神经网络依赖固定的标签空间和监督目标,但最近的大语言模型(LLM)方法往往忽视图上下文或依赖来自更大模型的蒸馏,限制了泛化能力。我们提出了 TRN-R1-Zero,一个仅通过强化学习训练的文本丰富网络推理框架。TRN-R1-Zero 通过邻居感知的群体相对策略优化目标,直接优化基础 LLM,该目标根据一种新颖的边际收益度量动态调整奖励,以有效引导模型向关系推理发展。与先前方法不同,TRN-R1-Zero 不需要监督式微调或由大规模推理模型生成的链式思考数据。广泛的实验在引用、超链接、社交和共购买 TRN 基准上均显示,TRN-R1-Zero 的优越性和鲁棒性。此外,严格依赖节点级训练,TRN-R1-Zero 实现了对边级和图级任务的零样本推理,拓展了跨域迁移的范围。该代码已公开 availability at https://github.com/superallen13/TRN-R1-Zero。

关键词

引用

@article{arxiv.2604.19070,
  title  = {TRN-R1-Zero: Text-rich Network Reasoning via LLMs with Reinforcement Learning Only},
  author = {Yilun Liu and Ruihong Qiu and Zi Huang},
  journal= {arXiv preprint arXiv:2604.19070},
  year   = {2026}
}