中文

面向可解释性和鲁棒性模型训练的混合归因先验

机器学习 2025-12-18 v1 人工智能

摘要

小型语言模型(SLMs)在需要低延迟和轻量部署的任务中广泛使用,尤其是分类任务。随着可解释性和鲁棒性的日益重要,解释导向学习(explanation-guided learning)已成为有效框架,通过引入归因式监督来指导训练;然而,从通用且可靠的归因先验(attribution priors)方面仍是重大挑战。通过分析分类情境下的代表性归因方法,我们发现虽然这些方法可可靠地突出显示与类别相关的标记,但往往聚焦于由语义相似类别共享的常见关键词。由于在标准训练下,这些类别本就难以区分,这些归因提供的判别线索不足,限制了其提高模型区分能力的潜力。为克服此限制,我们提出了类别感知归因先验(Class-Aware Attribution Prior, CAP),一种新型归因先验提取框架,引导语言模型捕获细粒度的类别区别并产生更显著、判别性的归因先验。基于此思想,我们进一步引入CAP Hybrid,将CAP的先验与现有归因技术的先验相结合,形成更全面且平衡的监督信号。通过将模型的自归因与这些丰富的先验一致,我们的方法鼓励学习多样化、决策相关的特征。在全数据、few-shot和对抗情境下的大量实验表明,我们的方法持续增强了可解释性和鲁棒性。

关键词

引用

@article{arxiv.2512.14719,
  title  = {Hybrid Attribution Priors for Explainable and Robust Model Training},
  author = {Zhuoran Zhang and Feng Zhang and Shangyuan Li and Yang Shi and Yuanxing Zhang and Wei Chen and Tengjiao Wang and Kam-Fai Wong},
  journal= {arXiv preprint arXiv:2512.14719},
  year   = {2025}
}

备注

15 pages