DuTrust:用于可信度评估的情感分析数据集
计算与语言
2021-09-08 v2 人工智能
摘要
尽管深度学习模型已极大提升多数人工智能任务的性能,但由于黑盒问题,它们常被认为不可信。因此,许多研究致力于探讨深度学习的可信度。然而,由于多数开放数据集专为评估模型输出准确性而设计,仍缺乏合适的用于评估神经网络内部机制的数据集。数据集的缺失明显阻碍了可信度研究的发展。因此,为系统评估构建可信系统的因素,我们提出一个新颖且标注良好的情感分析数据集,以评估鲁棒性与可解释性。为评估这些因素,我们的数据集包含关于实例挑战性分布的多样标注、人工对抗样本及情感解释。进一步提出了若干针对可解释性与鲁棒性的评估指标。基于该数据集与指标,我们对三种典型模型的可信度进行了全面比较,并研究了准确性、鲁棒性与可解释性之间的关系。我们在 \url{https://github/xyz} 发布该可信度评估数据集,希望我们的工作能推动面向真实应用构建更可信系统的进展。
引用
@article{arxiv.2108.13140,
title = {DuTrust: A Sentiment Analysis Dataset for Trustworthiness Evaluation},
author = {Lijie Wang and Hao Liu and Shuyuan Peng and Hongxuan Tang and Xinyan Xiao and Ying Chen and Hua Wu and Haifeng Wang},
journal= {arXiv preprint arXiv:2108.13140},
year = {2021}
}