SudoLM:基于授权对齐的参数化知识访问控制学习
计算与语言
2025-06-10 v3 人工智能
摘要
现有的偏好对齐机制是一种通用型对齐方式,large language model(LLM)的参数化知识中带有非偏好特征的部分会被统一屏蔽给所有用户。然而,这部分知识对经验丰富的用户(其专业资格使其能够处理此类信息)是有用的。通用的单一对齐机制削弱了LLM对这些合格用户的实用性。为此,我们提出了SudoLM框架,让LLMs通过授权对齐学习针对不同用户凭证的参数化知识访问控制。SudoLM允许获得授权的用户通过分配的SUDO密钥解锁对所有参数化知识的访问,而对非合格用户则屏蔽访问。实验在两个应用场景下表明,SudoLM有效控制了用户对参数化知识的访问,同时保持了其通用实用性。
引用
@article{arxiv.2410.14676,
title = {SudoLM: Learning Access Control of Parametric Knowledge with Authorization Alignment},
author = {Qin Liu and Fei Wang and Chaowei Xiao and Muhao Chen},
journal= {arXiv preprint arXiv:2410.14676},
year = {2025}
}
备注
ACL 2025