位置偏差对情绪原因抽取影响的实验研究
计算与语言
2020-07-31 v1
摘要
情绪原因抽取(ECE)旨在标注情绪关键词后从文档中识别情绪原因。已有一些基线方法被提出以解决该问题,如基于规则、基于常识和机器学习的方法。然而,我们表明,一种无需观察文本、对 ECE 进行简单随机选取的方法与这些基线方法性能相近。我们仅利用相对于情绪原因的位置信息来实现这一目标。由于仅使用不观察文本的位置信息便获得了更高的 F 值,我们由此揭示了 ECE 单一语料 Sina-news 基准中存在偏差。进一步分析显示,该基准中情绪原因位置存在不平衡,大多数原因从句紧邻中心情绪从句之前。我们从语言学视角审视该偏差,并表明当前利用位置信息的最先进深度学习模型的高准确率仅在含有此类位置偏差的数据集中才明显。当引入位置分布平衡的数据集时,准确率急剧下降。因此我们得出结论:正是该基准中的固有偏差导致了这些深度学习模型在 ECE 中的高准确率。我们希望本文的案例研究既提供警示教训,也为后续研究在解释深度学习模型优越性而不检查偏差时提供模板。
引用
@article{arxiv.2007.15066,
title = {An Experimental Study of The Effects of Position Bias on Emotion CauseExtraction},
author = {Jiayuan Ding and Mayank Kejriwal},
journal= {arXiv preprint arXiv:2007.15066},
year = {2020}
}
备注
9 pages, 2 figures, 9 tables, bias, position bias, unbalanced labels, deep neural network models