KIT-TIP-NLP 在 MultiPride:使用多语言基础模型进行持续学习
计算与语言
2026-05-19 v2 人工智能
机器学习
摘要
本文提出了一个用于检测多语言社交媒体话语中被重新占用的侮辱性词汇的多阶段框架。它解决了在英语、西班牙语和意大利语推文中识别被占用与非占用用法的挑战。框架处理数据稀缺、类别不平衡和跨语言情感表达差异等三个相互交织的方法论挑战。它集成了通过交叉验证的数据驱动模型选择、通过 back-translation 实现语义保持的增强、通过动态 epoch 级欠抽样的归纳迁移学习,以及通过掩码语言模型注入领域特定知识。系统评估了八个多语言嵌入模型,基于宏平均 F1 分数选定 XLM-RoBERTa 作为基础模型。通过 GPT-4o-mini back-translation 实现的数据增强有效地将训练语料翻倍以上,同时保持语义内容和类别分布比例。框架为评估 purposes 产生四个最终运行,其中 RUN 1 为带增强和欠抽样的归纳迁移学习,RUN 2 为掩码语言模型预训练,RUN 3 和 RUN 4 为通过 ROC 分析优化的语言特定决策阈值所细化的先前预测。语言特定阈值细化揭示,最优决策边界在不同语言之间存在显著差异。这反映了模型置信度得分和占用语言使用方式的语言差异。基于阈值的优化在无需模型重新训练的情况下提升了 2-5% 的绝对 F1 分数。该方法完全可复现,所有代码和实验设置均可用 https://github.com/rbg-research/MultiPRIDE-Evalita-2026 提供。
引用
@article{arxiv.2605.13415,
title = {KIT-TIP-NLP at MultiPride: Continual Learning with Multilingual Foundation Model},
author = {Barathi Ganesh HB and Michal Ptaszynski and Rene Melendez and Juuso Eronen},
journal= {arXiv preprint arXiv:2605.13415},
year = {2026}
}
备注
Final Workshop of the 9th evaluation campaign EVALITA 2026