中文

度量分类中的伪相关:翻译体中的“聪明汉斯”现象

计算与语言 2024-06-13 v2

摘要

近期研究揭示了高性能神经翻译体分类器中存在的“聪明汉斯”行为,即基于 BERT 的分类器利用数据与目标分类标签之间的伪相关(尤其是主题信息),而非真正的翻译体信号。翻译体信号十分微妙(尤其对于专业翻译而言),并与数据中诸多其他信号(如体裁、风格、作者,尤其是主题)相互竞争。这引出了一个普遍性问题:分类器的性能究竟有多少真正源于数据中的伪相关,又有多少源于分类器实际针对的目标信号,特别是在目标信号微妙且数据环境具有挑战性(低资源)的情况下。我们聚焦于基于主题的伪相关,并从两个方向探讨该问题:(i) 我们对伪主题信息及其在数据中的分布一无所知;(ii) 我们对伪主题相关的性质有所了解。针对 (i),我们从第一性原理出发提出一种度量,捕捉无监督主题与目标分类标签的对齐程度,以此作为数据中伪主题信息的指示。我们证明该度量等同于聚类中的纯度,并提出分类的“主题下限”(类似于“噪声下限”)。针对 (ii),我们研究在分类中对已知伪主题载体进行掩码处理。(i) 与 (ii) 均有助于量化伪相关,且 (ii) 有助于缓解伪相关。

关键词

引用

@article{arxiv.2308.13170,
  title  = {Measuring Spurious Correlation in Classification: 'Clever Hans' in Translationese},
  author = {Angana Borah and Daria Pylypenko and Cristina Espana-Bonet and Josef van Genabith},
  journal= {arXiv preprint arXiv:2308.13170},
  year   = {2024}
}

备注

Accepted to RANLP 2023 (oral)