评估文本风格迁移:面向九语言文本去污化的基准
计算与语言
2026-03-05 v2
摘要
尽管大型语言模型(LLM)取得了显著进展,但可靠地评估诸如文本风格迁移(TST)等文本生成任务仍是一个开放挑战。现有研究表明,自动评估指标与人类判断往往关联性较差(Dementieva 等,2024;Pauli 等,2025),限制了我们准确评估模型性能的能力。此外,大多数先前工作主要聚焦于英文语言,而对多语言 TST 系统,特别是文本去污化的评估,仍 largely 未被探索。本文提出了首个涵盖九种语言(阿拉伯语、阿姆哈拉语、中文、英文、德语、印地语、俄语、西班牙语和乌克兰语)的文本去污化评估的全面多语言基准测试。drawing inspiration from machine translation evaluation,我们比较了基于神经网络的自动指标与 LLM 作为评判者的方法,并进行了针对任务特定的微调模型实验。我们的分析表明,所提出的指标在与人类判断相关性方面显著优于基线方法。我们还提供了可操作的见解和实用指南,以构建面向文本去污化及相关 TST 任务的稳健可靠的多语言评估管道。
引用
@article{arxiv.2507.15557,
title = {Evaluating Text Style Transfer: A Nine-Language Benchmark for Text Detoxification},
author = {Vitaly Protasov and Nikolay Babakov and Daryna Dementieva and Alexander Panchenko},
journal= {arXiv preprint arXiv:2507.15557},
year = {2026}
}
备注
LREC 2026