ylmmcl 团队参加多语言文本去毒任务 2025:词典引导的去毒与分类器门控改写
计算与语言
2025-07-28 v1 机器学习
摘要
在本文中,我们介绍了 ylmmcl 团队在 PAN-2025 竞赛多语言文本去毒任务中的解决方案:一个稳健的多语言文本去毒流水线,集成了词典引导标注、微调的序列到序列模型(s-nlp/mt0-xl-detox-orpo)以及基于分类器的迭代门控机制。我们的方法不同于以往的无监督或单语流水线,通过利用 multilingual_toxic_lexicon 进行显式的有毒词标注,以更高的精度和跨语言泛化能力指导去毒过程。我们的最终模型在先前的尝试中取得了最高的 STA(0.922),并在开发集和测试集的有毒输入上获得了 0.612 的平均官方 J 分数。它还取得了 0.793(dev)和 0.787(test)的 xCOMET 分数。该性能在多种语言上优于基线和回译方法,并在高资源环境(英语、俄语、法语)中表现出强大的泛化能力。尽管在 SIM 上存在一些权衡,但该模型在去毒强度方面展现出一致的改进。在竞赛中,我们的团队以 0.612 的分数获得第九名。
引用
@article{arxiv.2507.18769,
title = {ylmmcl at Multilingual Text Detoxification 2025: Lexicon-Guided Detoxification and Classifier-Gated Rewriting},
author = {Nicole Lai-Lopez and Lusha Wang and Su Yuan and Liza Zhang},
journal= {arXiv preprint arXiv:2507.18769},
year = {2025}
}
备注
16 pages, 5 figures, 3 tables,