中文

QU-NLP at CheckThat! 2025:基于特征增强变换模型和顺序跨语言微调的新闻文章主客观性检测

计算与语言 2025-07-30 v1

摘要

本文介绍了我们方法用于 CheckThat! 2025 任务 1 的 approach,即主客观性检测,系统需区分新闻文章中句子是表达作者的主观观点还是对所涉及主题的客观表述。我们提出一种特征增强变换模型架构,将来自预训练语言模型的情境嵌入与统计与语言特征相结合。我们的系统利用预训练变换模型,额外加入词汇特征:针对阿拉伯语,我们使用 AraELECTRA 增添了词性标注(POS)标签和 TF-IDF 特征;而针对其他语言,我们通过门控机制对跨语言 DeBERTa~V3 模型结合 TF-IDF 特征进行微调。我们在单语、多语和零样本设置下评估了该系统,涵盖英语、阿拉伯语、德语、意大利语以及多个未见语言。结果显示,我们的方法在不同语言中均表现出竞争力,在英语(以宏平均 F1=0.8052 排名第 1)、德语(以宏平均 F1=0.8013 排名第 3)、阿拉伯语(以宏平均 F1=0.5771 排名第 4)以及罗马尼亚语(以零样本 setting 下的宏平均 F1=0.8126 排名第 1)等单语场景中取得了显著成绩。我们还进行了消融分析,证明了将 TF-IDF 特征与门控机制以及跨语言迁移在主客观性检测中的重要性。此外,我们的分析揭示了模型对跨语言微调顺序以及训练语言的语言相似性的敏感性。

关键词

引用

@article{arxiv.2507.21095,
  title  = {QU-NLP at CheckThat! 2025: Multilingual Subjectivity in News Articles Detection using Feature-Augmented Transformer Models with Sequential Cross-Lingual Fine-Tuning},
  author = {Mohammad AL-Smadi},
  journal= {arXiv preprint arXiv:2507.21095},
  year   = {2025}
}