通过安全过滤和宪法AI实现的负责任联邦LLM
计算与语言
2026-05-19 v2 分布式、并行与集群计算
多智能体系统
摘要
最近的研究越来越关注使用联邦学习训练大型语言模型(LLMs),即所谓的FedLLM。然而,负责任AI(RAI)旨在确保安全可靠的响应,在这一背景下仍未得到充分探索。在FedLLM中,客户端侧训练数据可能包含有害内容,导致生成不安全响应的LLMs。将此类模型聚合到全局模型并将其重新分发给客户端风险会导致不安全的LLMs广泛部署。为了解决这个问题,我们将两种成熟的RAI技术整合到FedLLM中:安全过滤和宪法AI。我们的实验显示,这些方法显著提高了LLM的安全性,在AdvBench上实现了超过20%的改进。
引用
@article{arxiv.2502.16691,
title = {Responsible Federated LLMs via Safety Filtering and Constitutional AI},
author = {Eunchung Noh and Jeonghun Baek},
journal= {arXiv preprint arXiv:2502.16691},
year = {2026}
}
备注
Accepted at the 6th Workshop on Trustworthy NLP (TrustNLP), ACL 2026