中文

面向越南语叙事文本的滥用文本片段检测

计算与语言 2023-12-14 v1 机器学习

摘要

各种形式的虐待,包括身体、心理、言语、性、财务和文化方面,均会对心理健康产生负面影响。然而,在越南将该领域的自然语言处理 (NLP) 应用于该领域的研究十分有限。因此,我们旨在通过构建一个用于检测越南语叙事文本中滥用内容的人工标注越南语数据集来做出贡献。我们从越南流行在线报纸 VnExpress 获取这些文本,该报纸的读者经常分享包含滥用内容的故事。在数据集创建过程中,识别和分类这些文本中的滥用文本片段带来了重大挑战,但也激发了我们的研究。我们通过冻结 PhoBERT 和 XLM-RoBERTa 并将其隐藏状态用于 BiLSTM 中,实验了轻量级基线模型,以评估数据集的复杂性。根据我们的实验结果,PhoBERT 在有标注和无标注的滥用文本片段检测任务中均优于其他模型。这些结果表明其具有未来改进的潜力。

关键词

引用

@article{arxiv.2312.07831,
  title  = {Abusive Span Detection for Vietnamese Narrative Texts},
  author = {Nhu-Thanh Nguyen and Khoa Thi-Kim Phan and Duc-Vu Nguyen and Ngan Luu-Thuy Nguyen},
  journal= {arXiv preprint arXiv:2312.07831},
  year   = {2023}
}

备注

Accepted at SoICT 2023