中文

从充分理由开始学习:分析解释忠诚度与标记级正则化策略之间的关系

计算与语言 2025-11-21 v1 人工智能

摘要

人类对自然语言的解释,理由,是评估模型是否为正确原因学习标签或依赖于数据集特定捷径的工具。充分性是衡量理由信息性的常用指标,但它仅提供有限关于理由信息对模型性能影响的见解。我们通过将充分性与两种建模范式相关联来解决这一限制:模型识别哪些标记是理由组成部分(通过标记分类)的能力,以及通过在输入中整合理由来提高模型性能(通过注意力正则化)的能力。我们发现,高度信息丰富的理由不太可能正确分类该实例。充分性反而捕捉到非理由化背景在同一输入中对理由信息的干扰。我们还发现,将理由信息整合到模型输入中可以提升跨域分类,但结果在不同任务和模型类型下不一致。最后,充分性和标记分类似乎没有关联。这些结果彰显了理由的复杂性,表明能够系统性地捕捉此类信息的指标值得进一步调查。

关键词

引用

@article{arxiv.2511.16353,
  title  = {Learning from Sufficient Rationales: Analysing the Relationship Between Explanation Faithfulness and Token-level Regularisation Strategies},
  author = {Jonathan Kamp and Lisa Beinborn and Antske Fokkens},
  journal= {arXiv preprint arXiv:2511.16353},
  year   = {2025}
}

备注

Long paper accepted to the main conference of AACL 2025. Please cite the conference proceedings when available