中文

ECPO:基于证据耦合的策略优化用于证据认证候选人排序

人工智能 2026-05-22 v1 机器学习

摘要

用于支持性决策场景的排序系统不仅要对候选人进行排序,还要暴露可独立核查的证据。我们研究证据认证候选人排序:给定intent_id、预定义计划框架、窗口局部候选人名单,以及带有跨度来源的文本派生候选人轨迹,系统必须输出Top-K列表,并附带doc_id:span证据证书,其引用的跨度足以恢复决策。我们在MAVEN-ERE和RAMS上实现了该任务,采用固定的上游抽取、窗口局部随机化候选标识符、框架对齐轨迹监督、hard负样本和审计参考。在此基础上,我们引入证据耦合策略优化(Evidence-Coupled Policy Optimization, ECPO),这是一种listwise策略优化目标,其动作为排序和证据证书的联合对象。ECPO首先从框架对齐、论证一致性和可选图特征学习可解释的轨迹奖励;随后优化带三个耦合奖励的受限策略:listwise排序效用、跨度级证书有效性,以及由无标签确定性验证器计算的证据循环奖励,该验证器从从claim中剥离的引用跨度重建候选支持。这一方法将目标从仅最大化普通NDCG转向最大化CertNDCG和决策-证据耦合。评估将ECPO与零shot、SFT、GRPO策略、仅RM评分搭配确定性证据附加、语法/JSON约束解码、验证器重试、最佳N RM选择以及事后证据理由化进行比较,涵盖封闭名册、预测名册和混合名册等设置。

关键词

引用

@article{arxiv.2605.21993,
  title  = {ECPO: Evidence-Coupled Policy Optimization for Evidence-Certified Candidate Ranking},
  author = {Miaobo Hu and Shuhao Hu and BoKun Wang and Yina Sa and Xin Wang and Xiaobo Guo and Daren Zha and Jun Xiao},
  journal= {arXiv preprint arXiv:2605.21993},
  year   = {2026}
}