PRISM:基于跨域遮蔽的概率再分配用于知识敏感对齐
计算与语言
2026-04-03 v1
摘要
基于标记级硬标签的监督微调(SFT)会放大对事实不充分支持目标的过度模仿,从而导致在多句生成中传播误认。我们研究一种增强型SFT设置,其中训练实例包括粗糙的句子级事实风险标签和跨句依赖注释,提供关于事实承诺弱ly支持位置的结构化信号。我们提出了\textbf{PRISM}——一种可微分的风险门控框架,仅在事实关键位置修改学习。PRISM增强了标准SFT,引入一种轻量级、模型感知的概率再分配目标,对风险目标标记的高置信度预测进行惩罚,其作用范围由跨域风险权重和模型感知门控控制。实验在误认敏感的事实基准和通用评估上显示,PRISM在各种 backbone 上均提升了事实聚合指标,同时保持了具竞争力的整体能力轮廓。消融实验进一步表明,辅助信号在保守使用时最为有效,知识遮蔽与模型感知再分配在事实纠正与能力保持之间发挥互补作用。
引用
@article{arxiv.2604.01682,
title = {PRISM: Probability Reallocation with In-Span Masking for Knowledge-Sensitive Alignment},
author = {Chenning Xu and Mao Zheng and Mingyang Song},
journal= {arXiv preprint arXiv:2604.01682},
year = {2026}
}