中文

采用非对称学习率的解耦合理化:一种灵活的 Lipschitz 约束

机器学习 2023-06-27 v3 计算与语言

摘要

自解释合理化模型通常由一个合作博弈构建:生成器从输入文本中选择最具人类可理解性的片段作为依据(rationales),随后预测器基于所选依据进行预测。然而,这种合作博弈可能出现退化问题——预测器过拟合于尚未训练充分的生成器所产生的无信息片段,进而使生成器收敛到一个倾向于选择无意义片段的次优模型。本文从理论层面将退化问题与预测器的 Lipschitz 连续性联系起来。接着,我们从经验上提出一种简单而有效的方法 DR,它能够自然且灵活地约束预测器的 Lipschitz 常数,以解决退化问题。DR 的核心思想是将生成器与预测器解耦,并为二者分配非对称学习率。在两个广泛使用的基准上开展的一系列实验验证了所提方法的有效性。代码:\href{https://github.com/jugechengzi/Rationalization-DR}{https://github.com/jugechengzi/Rationalization-DR}。

关键词

引用

@article{arxiv.2305.13599,
  title  = {Decoupled Rationalization with Asymmetric Learning Rates: A Flexible Lipschitz Restraint},
  author = {Wei Liu and Jun Wang and Haozhao Wang and Ruixuan Li and Yang Qiu and YuanKai Zhang and Jie Han and Yixiong Zou},
  journal= {arXiv preprint arXiv:2305.13599},
  year   = {2023}
}

备注

KDD 2023 research track