tmn 在 SemEval-2023 任务 9 中的工作:基于 XLM-T、谷歌翻译与集成学习的多语言推文亲密性检测
计算与语言
2023-12-19 v1 人工智能
信息检索
机器学习
摘要
本文描述了一个基于 Transformer 的系统,专为 SemEval-2023 任务 9:多语言推文亲密性分析而设计。该任务的目的是预测推文的亲密性,范围从 1(完全不亲密)到 5(非常亲密)。竞赛的官方训练集包含六种语言(英语、西班牙语、意大利语、葡萄牙语、法语和中文)的推文。测试集包含给定的六种语言以及带有四种训练集中未出现语言(印地语、阿拉伯语、荷兰语和韩语)的外部数据。我们提出了一种基于 XLM-T(一种适配推特领域的多语言 RoBERTa 模型)集成方案的解决方案。为提升未见语言的性能,每条推文都补充了其英文翻译。我们探究了在微调中已见语言与未见语言相比翻译数据的有效性,并估计了在基于 Transformer 的模型中使用翻译数据的策略。我们的解决方案在排行榜上排名第 4,同时在测试集上取得了 0.599 的总体 Pearson 相关系数 r。所提系统相比全部 45 次提交的平均得分提升了最高 0.088 的 Pearson 相关系数 r。
引用
@article{arxiv.2304.04054,
title = {tmn at SemEval-2023 Task 9: Multilingual Tweet Intimacy Detection using XLM-T, Google Translate, and Ensemble Learning},
author = {Anna Glazkova},
journal= {arXiv preprint arXiv:2304.04054},
year = {2023}
}
备注
7 pages. The 17th International Workshop on Semantic Evaluation (SemEval-2023)