中文

CheckThat! 2024任务:从多语言文本序列识别主观性

计算与语言 2024-07-16 v1

摘要

本研究解决一个二分类任务,用于确定文本序列(句子或段落)是主观还是客观。该任务涵盖五种语言:阿拉伯语、保加利亚语、英语、德语和意大利语,以及多语言类别。我们的主要方法包括几个关键技术。最初,我们通过词性标注(POS)处理数据、识别问号,并应用注意力掩码。我们对基于情感的Transformer模型'MarieAngeA13/Sentiment-Analysis-BERT'进行微调。鉴于目标数据更多,我们实现了自定义分类器,为目标数据分配更大的权重。此外,我们将非英语数据翻译成英文,以保持数据集的一致性。我们的模型取得了显著的结果,在多语言数据集(宏平均F1=0.7121)和德语(宏平均F1=0.7908)中取得优异成绩。在阿拉伯语(宏平均F1=0.4908)和保加利亚语(宏平均F1=0.7169)中名列第2,在意大利语(宏平均F1=0.7430)中名列第3,在英语(宏平均F1=0.6893)中名列第9。

关键词

引用

@article{arxiv.2407.10252,
  title  = {Nullpointer at CheckThat! 2024: Identifying Subjectivity from Multilingual Text Sequence},
  author = {Md. Rafiul Biswas and Abrar Tasneem Abir and Wajdi Zaghouani},
  journal= {arXiv preprint arXiv:2407.10252},
  year   = {2024}
}