ViHateT5:用于越南语仇恨言论检测的统一文本-文本变换模型
计算与语言
2024-06-05 v2
摘要
近期越南语仇恨言论检测(Hate Speech Detection, HSD)研究取得显著进展,主要归功于基于 BERT 架构的 transformer 预训练语言模型的出现。然而,针对不同任务开发专用微调模型的做法导致了开发多任务 HSD 系统的复杂性和碎片化。此外,现有大多数方法聚焦于微调通用预训练模型,而这些模型主要在维基百科等正式文本数据集上训练,可能难以准确捕捉线上平台上人的类行为。在本研究中,我们提出 ViHateT5,一种基于 T5 架构的模型,通过我们提出的大规模领域特定数据集 VOZ-HSD 进行预训练。凭借文本-文本架构的优势,ViHateT5 可用单一模型解决多种任务,并在所有标准越南语 HSD 基准测试中实现最先进性能。我们的实验还强调了预训练数据中标签分布对模型效果的重要性。我们提供实验材料供研究使用,包括 VOZ-HSD 数据集、预训练模型checkpoint、统一的 HSD 多任务 ViHateT5 模型以及相关源码,已在 GitHub 上公开。
引用
@article{arxiv.2405.14141,
title = {ViHateT5: Enhancing Hate Speech Detection in Vietnamese With A Unified Text-to-Text Transformer Model},
author = {Luan Thanh Nguyen},
journal= {arXiv preprint arXiv:2405.14141},
year = {2024}
}
备注
Accepted at ACL'2024 (Findings)