中文

基于隐特征的训练-测试数据划分以改进泛化评估:仇恨言论检测案例研究

计算与语言 2023-11-20 v1

摘要

随着社交媒体平台日益增多,有害内容的传播加剧,对鲁棒仇恨言论检测系统的需求也随之增长。此类系统易对特定目标与关键词过拟合,且在评估时若不考虑训练与测试数据间可能发生的分布偏移,会高估其效用。我们通过基于模型隐表示聚类对现有数据集进行新的训练-测试划分,来对仇恨言论模型提出挑战。我们提出两种划分变体(Subset-Sum-Split 与 Closest-Split),当应用于两个数据集并使用四个预训练模型时,揭示了模型如何在隐空间盲点上发生灾难性失效。当使用一个模型开发划分并在另一模型上评估时,该结果具有泛化性。我们的分析表明,数据划分不存在与性能下降相关的清晰表层属性,这凸显任务难度并非总可被人解释。我们建议在模型开发中纳入基于隐特征的划分,并通过 GenBench 基准发布两种划分。

关键词

引用

@article{arxiv.2311.10236,
  title  = {Latent Feature-based Data Splits to Improve Generalisation Evaluation: A Hate Speech Detection Case Study},
  author = {Maike Züfle and Verna Dankers and Ivan Titov},
  journal= {arXiv preprint arXiv:2311.10236},
  year   = {2023}
}

备注

Accepted at the GenBench workshop at EMNLP 2023; 9 pages in the main paper, 5 pages with references and 4 pages with appendices