中文

MultiParaDetox:利用平行数据将文本去毒扩展至新语言

计算与语言 2024-04-03 v1 人工智能

摘要

文本去毒是一项文本风格迁移 (TST) 任务,即将文本从有毒的表层形式(例如包含粗鄙词汇)改写为中性语域。近期,文本去毒方法在多种任务中得到了应用,例如大型语言模型 (LLM) 的去毒 (Leong et al., 2023; He et al., 2024; Tang et al., 2023) 以及社交网络中的有毒言论治理 (Deng et al., 2023; Mun et al., 2023; Agarwal et al., 2023)。所有这些应用对于确保现代数字世界中的安全交流都极为重要。然而,此前用于收集平行文本去毒语料库的方法——ParaDetox (Logacheva et al., 2022) 和 APPADIA (Atwell et al., 2022)——仅在单语设置下进行了探索。在这项工作中,我们旨在将 ParaDetox 流程扩展至多种语言,提出 MultiParaDetox 以自动化收集潜在适用于任何语言的平行去毒语料库。随后,我们在所提供的平行语料库上使用不同的文本去毒模型进行实验——从无监督基线到 LLM 和微调模型——展示了平行语料库的存在对于为任何语言获取最先进的文本去毒模型的巨大益处。

关键词

引用

@article{arxiv.2404.02037,
  title  = {MultiParaDetox: Extending Text Detoxification with Parallel Data to New Languages},
  author = {Daryna Dementieva and Nikolay Babakov and Alexander Panchenko},
  journal= {arXiv preprint arXiv:2404.02037},
  year   = {2024}
}

备注

Accepted to NAACL2024