以共情数据缓解毒性退化:探索毒性与共情的关系
计算与语言
2022-05-17 v1 人工智能
摘要
大型预训练神经语言模型已支撑了许多自然语言处理(NLP)任务的有效性,但仍易生成有毒语言,妨碍其使用安全性。我们利用共情数据,改进了近期旨在降低生成文本毒性的可控文本生成工作。我们发现,通过基于共情分数对数据进行策略性采样,能够将微调数据规模大幅缩减至 7.5-30k 样本,同时在毒性缓解上相较原始基于 2.3m 样本的最优方法取得显著改进,绝对降低幅度最高达 3.4%(相对降低 26%)。我们观察到改进程度取决于共情的具体沟通成分。特别是,共知的认知成分在几乎所有实验中均显著优于原始数据集,而情感共情则与较少的改进相关,甚至不及原始数据的随机样本。对于涉及共情的 NLP 工作而言,这是一个颇具启示的见解,因为直至最近,为此构建的研究与资源都仅将共情视为情感概念。
引用
@article{arxiv.2205.07233,
title = {Mitigating Toxic Degeneration with Empathetic Data: Exploring the Relationship Between Toxicity and Empathy},
author = {Allison Lahnala and Charles Welch and Béla Neuendorf and Lucie Flek},
journal= {arXiv preprint arXiv:2205.07233},
year = {2022}
}
备注
Accepted to NAACL 2022