打破mBad!跨语言无害化的监督微调
计算与语言
2025-10-24 v3 人工智能
摘要
随着大语言模型(LLMs)在全球应用中日益普及,确保其在多样化语言语境下无毒性仍是一个关键挑战。我们探索了“跨语言无害化”(Cross-lingual Detoxification)范式,这一范式可实现跨不同脚本族中高资源语言和低资源语言之间的毒性缓解,从而实现无害化能力的迁移。我们通过392个广泛的设置分析了跨语言无害化的有效性,以评估在数据有限的跨分布设置中的毒性降低情况,并调查缓解措施对非毒性任务中模型性能的影响,揭示了安全性与知识保留之间的权衡。我们的代码和数据集已公开available at https://github.com/himanshubeniwal/Breaking-mBad。
引用
@article{arxiv.2505.16722,
title = {Breaking mBad! Supervised Fine-tuning for Cross-Lingual Detoxification},
author = {Himanshu Beniwal and Youngwoo Kim and Maarten Sap and Soham Dan and Thomas Hartvigsen},
journal= {arXiv preprint arXiv:2505.16722},
year = {2025}
}
备注
Accepted at MELT Workshop @ COLM 2025