中文

基于情感极性一致性改写的中文有毒语言缓解

计算与语言 2025-05-22 v1

摘要

在保留说话者原始意图的前提下消除冒犯性语言是提升线上交互质量的挑战性且关键任务。虽然大型语言模型 (LLM) 在改写有毒内容方面显示出前景,但它们往往会默认进行过于礼貌的改写,从而扭曲情感语气和交际意图。这一问题在中文中尤为突出,因为中文的有毒性往往通过表情符号、同音字或话语语境中隐式地体现。我们提出 ToxiRewriteCN,这是第一个专为保留情感极性而设计的中文消毒数据集。该数据集包含 1,556 组精心标注的三元组,每组包括一个有毒句子、一个情感对齐的非有毒改写版本以及标注的有毒 span。它覆盖五种真实场景:标准表达、表情符号引发的有毒性和同音字有毒性,以及单轮和多轮对话。我们评估了 17 个大型语言模型,包括商业和开源模型,其架构各异,从四个维度(消毒准确性、流畅性、内容保留和情感极性)进行测试。结果表明,尽管商业模型和 Mixture of Experts (MoE) 模型总体表现最佳,但所有模型在处理更为细微或依赖语境的输入时(如表情符号、同音字和对话)都难以在安全性与情感忠诚度之间取得平衡。我们发布 ToxiRewriteCN 以支持未来在中文可控、情感感知消毒方面的研究。

关键词

引用

@article{arxiv.2505.15297,
  title  = {Chinese Toxic Language Mitigation via Sentiment Polarity Consistent Rewrites},
  author = {Xintong Wang and Yixiao Liu and Jingheng Pan and Liang Ding and Longyue Wang and Chris Biemann},
  journal= {arXiv preprint arXiv:2505.15297},
  year   = {2025}
}

备注

14 pages, 7 figures