中文

面向数据导向自我解释理性化的可学习博弈论策略优化

人工智能 2025-10-16 v1

摘要

理性化(rationalization)是一种数据导向的框架,旨在构建自我解释模型,通过生成输入数据的一子集来解释预测结果,该子集对人类可理解。它涉及一个合作博弈模型,其中生成器生成输入中最具人类可解释性的部分(即理由),随后由预测器基于这些生成的理由进行预测。常规的理性化方法通常通过正则化项来施加约束,以校准或惩罚不良的生成。然而,这些方法受到一种称为模式坍塌(mode collapse)的问题的困扰,即预测器产生正确的预测,但生成器持续输出具有坍塃模式的理由。此外,现有研究通常为特定的坍塃模式单独设计,缺乏统一的考虑。在本文中,我们从一种新颖的博弈论视角重新审视合作理性化,识别了导致此问题的根本原因:生成器不再倾向于探索新策略来发现有信息的理由,从而导致系统收敛到次优的博弈均衡(正确预测 v.s 坍塃理由)。为解决此问题,我们提出了一种新方法:基于博弈论策略优化的 RATionalization(PORAT),该方法在合作博弈过程中逐步引入策略干预,以解决博弈均衡,从而引导模型趋向更优的解状态。我们理论上分析了导致次优均衡的原因,并证明了所提方法的可行性。此外,我们在九个广泛使用的真实数据集和两个合成设置上验证了该方法,其中 PORAT 相较于现有最先进方法实现了最高可达 8.1% 的性能提升。

关键词

引用

@article{arxiv.2510.13393,
  title  = {Learnable Game-theoretic Policy Optimization for Data-centric Self-explanation Rationalization},
  author = {Yunxiao Zhao and Zhiqiang Wang and Xingtong Yu and Xiaoli Li and Jiye Liang and Ru Li},
  journal= {arXiv preprint arXiv:2510.13393},
  year   = {2025}
}

备注

14 pages, 7 figures, 11 tables. Under review by IEEE