TypedCSIP:面向中文立法冲突分类的类型化反事实预训练方法
计算与语言
2026-05-26 v1
摘要
TypedCSIP是一种用于LCR-CN基准(Zhao等,2026)冲突分类任务的类型化反事实预训练方法:给定(上级、下级)条款对,预测该对是否冲突以及由四种法律学说类型(责任、条件、制裁、定义)描述的冲突类型。我们利用LCR-CN中专家编写的最小修订作为训练时的反事实监督;在测试阶段,分类器仅读取原始条款对。阶段1在(上级、下级、专家修订)三元组上,以类型化反事实选择性干预预训练目标对共享编码器进行预训练,将专家修订视为必须判定为不携带冲突证据的反事实。阶段2将编码器迁移到五向分类头。该确认性测试已在Open Science Framework上注册,观察v6测量结果前:18个随机种子,锁定规则要求平均每个随机种子差至少0.8个百分点,且种子自助和Student-t 95%下界均为正。于696记录的测试集上,v2变体在chinese-roberta-wwm-ext上比最强单模型基线提高0.916个百分点,在SAILER跨骨干复制上提高1.288个百分点;两个单元格都通过该规则。在244条未见gB记录上的冷启动分层结果维持了正向收益。跨任务诊断显示,阶段2的编码器具有分类专化性,无法迁移至LCR-CN的上级法律检索任务,因此我们将贡献限定于冲突分类。我们发布代码、72个预注册预测文件、匹配随机种子和MLM控制辅助文件,以及OSF预注册记录。
引用
@article{arxiv.2605.25474,
title = {TypedCSIP: Typed Counterfactual Pretraining for Chinese Legislative Conflict Classification},
author = {Yao Liu},
journal= {arXiv preprint arXiv:2605.25474},
year = {2026}
}