从一到多:扩展语言模型中毒性缓解的范围
计算与语言
2024-05-31 v3 人工智能
摘要
迄今为止,语言模型中的毒性缓解几乎完全集中在单语言设置上。随着语言模型拥抱多语言能力,我们的安全措施必须与时俱进。认识到这一研究空白,我们的方法扩展了传统毒性缓解的范围,以应对多种语言带来的复杂性。在缺乏跨语言足够标注数据集的情况下,我们利用翻译数据来评估和增强我们的缓解技术。我们还比较了在静态和持续毒性缓解场景下,微调缓解方法与检索增强技术的效果。这使我们能够检查翻译质量和跨语言迁移对毒性缓解的影响。我们还探讨了模型规模和数据量如何影响这些缓解工作的成功与否。涵盖九种语言,我们的研究代表了广泛的语系和资源可用性水平,从高资源语言到中等资源语言不等。通过全面的实验,我们提供了关于多语言毒性缓解复杂性的见解,为这一日益重要的领域的未来研究提供了宝贵的启示并铺平了道路。代码和数据可在 https://github.com/for-ai/goodtriever 获取。
引用
@article{arxiv.2403.03893,
title = {From One to Many: Expanding the Scope of Toxicity Mitigation in Language Models},
author = {Luiza Pozzobon and Patrick Lewis and Sara Hooker and Beyza Ermis},
journal= {arXiv preprint arXiv:2403.03893},
year = {2024}
}