基于本土样本混合提升面向印地语-英语代码混合情绪检测能力:案例研究
偏微分方程分析
2024-12-09 v2
摘要
情绪检测长期以来一直是 NLP 社区的难题。面向代码混合环境的情绪检测任务更为复杂,因为模型必须理解情绪在语言变体中的表达。与单语场景相比,代码混合情绪检测的研究工作更少,因为缺乏大规模标注的代码混合仇恨语料库。为克服这一瓶颈,我们提出使用本土语言情绪样本(以下简称本土样本)。我们假设在多语言语言模型(MLM)时代,代码混合情绪可主要依赖于本土语言样本进行检测。尽管 NLP 文献报告了 MLM 在许多跨语言情绪检测情形下的有效性,但其在代码混合场景中的广泛评估尚未完成。本文通过严谨的实验研究填补了这一空白。我们以印地语-英语代码混合场景作为案例研究,因为我们对该语言具有专业知识。我们得到的一些有趣观察包括:(i)即使仅以少量本土情绪样本加入代码混合训练集,也能显著提升 MLM 在代码混合情绪检测中的性能;(ii)仅使用本土样本训练的 MLM 也能在很大程度上检测代码混合情绪;(iii)注意力得分的可视化显示,在训练中包含本土样本后,MLM 能更好地聚焦于代码混合语境中的情绪词汇;(iv)最后,当情绪具有主观性或讽刺性时,简单地混合本土样本对检测代码混合情绪帮助不大。我们将公开数据和代码仓库以复现报告结果。
引用
@article{arxiv.2405.20754,
title = {Non-uniqueness of weak solutions to 2D generalized Navier-Stokes equations},
author = {Xinliang Li and Zhong Tan},
journal= {arXiv preprint arXiv:2405.20754},
year = {2024}
}
备注
31 pages