PoLi-RL:面向条件语义文本相似性的点到列表强化学习框架
计算与语言
2026-03-03 v3
摘要
条件语义文本相似性(C-STS)衡量特定条件下文本片段之间的语义接近程度,从而克服了传统STS方法的模糊性。然而,现有方法局限于判别式模型,未能充分发挥大语言模型(LLM)和强化学习(RL)在NLP领域的最新突破。RL特别适合这一任务,因其可直接优化非可微的Spearman排序指标,并引导C-STS所需的推理过程。然而,我们发现,单纯应用列表级RL难以取得有意义的改进,因模型难以处理复杂的粗粒度奖励信号,导致优化困难。为此,我们提出PoLi-RL,一种 novel 点到列表强化学习框架。PoLi-RL采用两阶段课程训练:首先以简单的数据驱动奖励训练模型以建立基本评分能力,然后过渡到结合数据驱动、两两级和列表级目标的混合奖励,以细化模型辨别细微语义差异的能力。关键的是,我们提出一种创新的平行切片排序奖励(PSRR)机制,该机制在平行切片中计算排序奖励,其中每个切片由来自不同样本相同索引的 completions 组成。这为每个 individual completion 提供精确的、有区分度的学习信号,实现细粒度的信用分配和有效优化。在官方C-STS基准测试中,PoLi-RL实现了48.18的Spearman相关系数,为cross-encoder架构建立了新的SOTA。作为首个成功将RL应用于C-STS的工作,本文引入了一种强大的范式,用于对齐LLM以解决复杂、基于排序的条件判断任务。
关键词
引用
@article{arxiv.2510.04080,
title = {PoLi-RL: A Point-to-List Reinforcement Learning Framework for Conditional Semantic Textual Similarity},
author = {Zixin Song and Bowen Zhang and Qian-Wen Zhang and Di Yin and Xing Sun and Chunping Li},
journal= {arXiv preprint arXiv:2510.04080},
year = {2026}
}