古德哈特定律适用于自然语言处理的解释基准
计算与语言
2023-08-29 v1 机器学习
摘要
尽管基于显著性的解释日益流行,研究界仍陷入僵局,面临对其目的、效力及相互矛盾倾向的质疑。为围绕共同目标团结社区努力,近期若干工作提出了评估指标。本文批判性地考察两组指标:ERASER 指标(完备性与充分性)与 EVAL-X 指标,并将探究聚焦于自然语言处理。首先,我们展示可在不改变模型对分布内测试输入的预测或解释的情况下,大幅虚高其完备性与充分性得分。我们的策略利用了所提取解释及其补集相对于彼此与分布内输入均“超出支持”的倾向。接着,我们证明即便 EVAL-X 正是为应对此类漏洞而提出,仍可通过一种对标签进行编码的简单方法任意虚高其指标。我们的结果令当前指标引导可解释性研究的能力受到质疑,并凸显出对这类指标究竟意在捕捉什么进行更广泛重估的必要性。
引用
@article{arxiv.2308.14272,
title = {Goodhart's Law Applies to NLP's Explanation Benchmarks},
author = {Jennifer Hsia and Danish Pruthi and Aarti Singh and Zachary C. Lipton},
journal= {arXiv preprint arXiv:2308.14272},
year = {2023}
}