CAREF:无需理由监督的、面向解释忠实性的校准感知正则化方法
机器学习
2026-05-28 v1 计算与语言
摘要
我们引入了CAREF,一种参数高效的微调框架,通过校准感知正则化联合优化预测准确性和解释忠实性。其核心在于,CAREF通过一个统一的损失函数——面向解释忠实性的校准感知正则化(LSCED),将基于熵的校准与词元级别的稀疏性控制耦合起来,且无需理由监督。在四个NLE基准(COS-E、ECQA、ComVE、e-SNLI)上使用Flan-T5进行评估,我们轻量级的CAREF-AQ变体仅使用6.43%的可训练参数,就达到了最佳平均准确率(89.04)和解释对齐度(81.00 nBERT),优于LoRA和AdaLoRA。据我们所知,CAREF是首个在单一训练目标中统一熵正则化和稀疏性正则化,用于可解释大语言模型微调的方法。
引用
@article{arxiv.2605.27835,
title = {CAREF: Calibration-Aware Regularization for Explanation Faithfulness Without Rationale Supervision},
author = {Naphat Nithisopa and Teerapong Panboonyuen},
journal= {arXiv preprint arXiv:2605.27835},
year = {2026}
}
备注
10 pages