中文

ylmmcl 团队参加多语言文本去毒任务 2025:词典引导的去毒与分类器门控改写

计算与语言 2025-07-28 v1 机器学习

摘要

在本文中,我们介绍了 ylmmcl 团队在 PAN-2025 竞赛多语言文本去毒任务中的解决方案:一个稳健的多语言文本去毒流水线,集成了词典引导标注、微调的序列到序列模型(s-nlp/mt0-xl-detox-orpo)以及基于分类器的迭代门控机制。我们的方法不同于以往的无监督或单语流水线,通过利用 multilingual_toxic_lexicon 进行显式的有毒词标注,以更高的精度和跨语言泛化能力指导去毒过程。我们的最终模型在先前的尝试中取得了最高的 STA(0.922),并在开发集和测试集的有毒输入上获得了 0.612 的平均官方 J 分数。它还取得了 0.793(dev)和 0.787(test)的 xCOMET 分数。该性能在多种语言上优于基线和回译方法,并在高资源环境(英语、俄语、法语)中表现出强大的泛化能力。尽管在 SIM 上存在一些权衡,但该模型在去毒强度方面展现出一致的改进。在竞赛中,我们的团队以 0.612 的分数获得第九名。

关键词

引用

@article{arxiv.2507.18769,
  title  = {ylmmcl at Multilingual Text Detoxification 2025: Lexicon-Guided Detoxification and Classifier-Gated Rewriting},
  author = {Nicole Lai-Lopez and Lusha Wang and Su Yuan and Liza Zhang},
  journal= {arXiv preprint arXiv:2507.18769},
  year   = {2025}
}

备注

16 pages, 5 figures, 3 tables,