用于滥用语言检测中少样本跨语言迁移的邻近风险最小化
计算与语言
2023-11-06 v1
摘要
从高资源语言向中、低资源语言的跨语言迁移学习已展现出令人鼓舞的结果。然而,目标语言资源的稀缺仍是一项挑战。本工作中,我们借助数据增强与用于领域自适应的持续预训练来改进跨语言滥用语言检测。对于数据增强,我们分析了两种基于邻近风险最小化的现有技术,并提出 MIXAG,一种基于表征夹角对实例对进行插值的新型数据增强方法。我们的实验涉及七种与英语类型学相异的语言与三个不同领域。结果显示,数据增强策略能够提升少样本跨语言滥用语言检测。具体而言,我们观察到在所有目标语言中,MIXAG 在多领域与多语言环境下均有显著提升。最后,我们通过误差分析表明,领域自适应有利于滥用文本类别(减少假阴性),但同时降低了滥用语言检测模型的精确率。
引用
@article{arxiv.2311.02025,
title = {Vicinal Risk Minimization for Few-Shot Cross-lingual Transfer in Abusive Language Detection},
author = {Gretel Liz De la Peña Sarracén and Paolo Rosso and Robert Litschko and Goran Glavaš and Simone Paolo Ponzetto},
journal= {arXiv preprint arXiv:2311.02025},
year = {2023}
}
备注
Accepted at EMNLP 2023 (Main Conference)