中文

SafeWebUH在SemEval-2023任务11:贬损文本中标注者分歧的学习:直接训练与聚合的对比

计算与语言 2023-05-03 v1 机器学习 社会与信息网络

摘要

主观性与意见差异是关键的社会现象,在贬损文本内容的标注与检测过程中考虑这些至关重要。本文使用SemEval-2023任务11提供的四个数据集,并微调BERT模型以捕捉标注中的分歧。我们发现,相较于直接在软标签上训练,个体标注者建模与聚合使交叉熵分数平均降低0.21。我们的发现进一步表明,标注者元数据有助于交叉熵分数平均降低0.029。

关键词

引用

@article{arxiv.2305.01050,
  title  = {SafeWebUH at SemEval-2023 Task 11: Learning Annotator Disagreement in Derogatory Text: Comparison of Direct Training vs Aggregation},
  author = {Sadat Shahriar and Thamar Solorio},
  journal= {arXiv preprint arXiv:2305.01050},
  year   = {2023}
}

备注

SemEval Task 11 paper (System)