SafeWebUH在SemEval-2023任务11:贬损文本中标注者分歧的学习:直接训练与聚合的对比
计算与语言
2023-05-03 v1 机器学习
社会与信息网络
摘要
主观性与意见差异是关键的社会现象,在贬损文本内容的标注与检测过程中考虑这些至关重要。本文使用SemEval-2023任务11提供的四个数据集,并微调BERT模型以捕捉标注中的分歧。我们发现,相较于直接在软标签上训练,个体标注者建模与聚合使交叉熵分数平均降低0.21。我们的发现进一步表明,标注者元数据有助于交叉熵分数平均降低0.029。
引用
@article{arxiv.2305.01050,
title = {SafeWebUH at SemEval-2023 Task 11: Learning Annotator Disagreement in Derogatory Text: Comparison of Direct Training vs Aggregation},
author = {Sadat Shahriar and Thamar Solorio},
journal= {arXiv preprint arXiv:2305.01050},
year = {2023}
}
备注
SemEval Task 11 paper (System)