MemeMind 在 ArAIEval 共享任务中:通过说服技巧识别定位阿拉伯语文本中的说服性片段
计算与语言
2024-08-09 v1
摘要
本文聚焦于检测来自推文和新闻段落的阿拉伯语文本中的宣传性片段和说服技巧。数据集中的每个条目包含一个文本样本和相应的标签,这些标签指示了文本内宣传技巧的开始和结束位置。落在标记片段内的词元被分配为“B”(开始)或“I”(内部),“O”,对应于特定的宣传技巧。使用注意力掩码,我们为每个片段创建了统一的长度,并根据提供的标签为每个词元分配了 BIO 标签。然后,我们使用 AraBERT-base 预训练模型进行阿拉伯语文本词元化和嵌入,并添加一个词元分类层来识别宣传技巧。我们的训练过程涉及两阶段微调方法。首先,我们仅训练分类层几个周期,然后进行全模型微调,更新所有参数。这种方法使模型能够适应宣传检测任务的特定特征,同时利用预训练 AraBERT 模型捕获的知识。我们的方法取得了 0.2774 的 F1 分数,在任务 1 的排行榜上获得了第 3 名。
引用
@article{arxiv.2408.04540,
title = {MemeMind at ArAIEval Shared Task: Spotting Persuasive Spans in Arabic Text with Persuasion Techniques Identification},
author = {Md Rafiul Biswas and Zubair Shah and Wajdi Zaghouani},
journal= {arXiv preprint arXiv:2408.04540},
year = {2024}
}