俄语文本解毒方法
计算与语言
2021-05-20 v1 机器学习
摘要
我们首次开展俄语文本自动解毒以对抗攻击性语言的研究。此类文本风格迁移可用于例如处理社交媒体中的有毒内容。尽管英语在该领域已有大量工作,俄语尚无人解决。我们测试两类模型——基于 BERT 架构、执行局部修正的无监督方法,以及基于预训练 GPT-2 语言模型的有监督方法——并与若干基线比较。此外,我们描述评测设置,提供训练数据集与自动评测指标。结果表明所测方法可成功用于解毒,但仍有改进空间。
引用
@article{arxiv.2105.09052,
title = {Methods for Detoxification of Texts for the Russian Language},
author = {Daryna Dementieva and Daniil Moskovskiy and Varvara Logacheva and David Dale and Olga Kozlova and Nikita Semenov and Alexander Panchenko},
journal= {arXiv preprint arXiv:2105.09052},
year = {2021}
}