中文

自我合理化是否能提升对虚假相关性的鲁棒性?

计算与语言 2022-10-26 v1 人工智能

摘要

合理化是人类推理与学习的基础。被训练为连同预测一并产生理由的 NLP 模型,称为自我合理化模型,已因其可解释性及对终端用户的效用被研究。然而,以人工书写理由进行训练在多大程度上促进学习仍属未被充分探索的问题。我们探究训练模型自我合理化能否助其学习以正确理由完成任务。具体而言,我们评估在六种不同规模的微调编码器—解码器与仅解码器模型中,以自由文本理由训练自我合理化模型如何影响对虚假相关性的鲁棒性。我们通过测量在 1)人工标注挑战数据集与 2)依赖虚假相关性将无法得出正确答案的原始测试集子集上的表现来评估对虚假相关性的鲁棒性。我们发现,尽管自我合理化在低资源设定下可改善对虚假相关性的鲁棒性,其在较高资源设定下往往损害鲁棒性。此外,这些效应取决于模型族与规模,以及理由内容。综上,我们的结果表明可解释性可能以鲁棒性为代价;因此,在以创建更可信模型为目标训练自我合理化模型时,应予以适当审慎。

关键词

引用

@article{arxiv.2210.13575,
  title  = {Does Self-Rationalization Improve Robustness to Spurious Correlations?},
  author = {Alexis Ross and Matthew E. Peters and Ana Marasović},
  journal= {arXiv preprint arXiv:2210.13575},
  year   = {2022}
}