中文

DefVerify:仇恨言论模型是否反映其数据集定义?

计算与语言 2025-01-14 v2

摘要

在构建预测模型时,很难确保最终部署的模型编码了应用程序特定的要求。考虑从事仇恨言论检测的研究人员而言,他们将拥有仇恨言论的看法,但构建一个准确反映其观点的模型需要在数据集构建和模型训练的整个工作流程中保持这些理想。诸如抽样偏差、注释偏差和模型误拟等问题几乎总是会出现,可能导致应用程序规范与模型在部署后实际行为之间的差距。为了解决这个问题,我们提出了 DefVerify:一个三步流程:(i) 编码用户指定的仇恨言论定义;(ii) 量化模型多大程度上反映了预期的定义;(iii) 尝试识别工作流程中的失败点。我们使用 DefVerify 对六个流行的仇恨言论基准数据集应用 DefVerify,以发现定义与模型行为之间的差距。

关键词

引用

@article{arxiv.2410.15911,
  title  = {DefVerify: Do Hate Speech Models Reflect Their Dataset's Definition?},
  author = {Urja Khurana and Eric Nalisnick and Antske Fokkens},
  journal= {arXiv preprint arXiv:2410.15911},
  year   = {2025}
}

备注

Camera-ready COLING 2025