基于隐特征的训练-测试数据划分以改进泛化评估:仇恨言论检测案例研究
计算与语言
2023-11-20 v1
摘要
随着社交媒体平台日益增多,有害内容的传播加剧,对鲁棒仇恨言论检测系统的需求也随之增长。此类系统易对特定目标与关键词过拟合,且在评估时若不考虑训练与测试数据间可能发生的分布偏移,会高估其效用。我们通过基于模型隐表示聚类对现有数据集进行新的训练-测试划分,来对仇恨言论模型提出挑战。我们提出两种划分变体(Subset-Sum-Split 与 Closest-Split),当应用于两个数据集并使用四个预训练模型时,揭示了模型如何在隐空间盲点上发生灾难性失效。当使用一个模型开发划分并在另一模型上评估时,该结果具有泛化性。我们的分析表明,数据划分不存在与性能下降相关的清晰表层属性,这凸显任务难度并非总可被人解释。我们建议在模型开发中纳入基于隐特征的划分,并通过 GenBench 基准发布两种划分。
引用
@article{arxiv.2311.10236,
title = {Latent Feature-based Data Splits to Improve Generalisation Evaluation: A Hate Speech Detection Case Study},
author = {Maike Züfle and Verna Dankers and Ivan Titov},
journal= {arXiv preprint arXiv:2311.10236},
year = {2023}
}
备注
Accepted at the GenBench workshop at EMNLP 2023; 9 pages in the main paper, 5 pages with references and 4 pages with appendices