中文

大型语言模型(LLM)可信、安全与合乎伦理的开发及部署的护栏

密码学与安全 2026-01-22 v1 人工智能 计算机与社会

摘要

人工智能时代已将大型语言模型(LLM)推至技术前沿,这在 2023 年备受热议,并可能在未来许多年持续如此。LLM 是支撑诸如 ChatGPT 等生成式人工智能应用的人工智能模型。这些人工智能模型,凭借海量数据和强大计算能力的驱动,已经释放出非凡的能力,从生成类人文本到辅助自然语言理解(NLU)任务。它们已迅速成为无数应用和软件服务正在构建或至少正在增强的基础。然而,与任何突破性创新一样,LLM 的兴起也带来了关键的安全、隐私和伦理问题。这些模型被发现倾向于泄露私人信息、产生虚假信息,并且可能被胁迫生成可用于不良行为者甚至普通用户无意中用于邪恶目的的内容。实施保障措施和护栏技术对于确保 LLM 生成的内容安全、可靠且合乎伦理的应用至关重要。因此,构建通过应用实现来防止这些模型被滥用的机制框架势在必行。在本研究中,我们提出了一种带有可信与安全模块的灵活自适应排序机制,可用于为 LLM 的开发和部署实施安全护栏。

关键词

引用

@article{arxiv.2601.14298,
  title  = {Guardrails for trust, safety, and ethical development and deployment of Large Language Models (LLM)},
  author = {Anjanava Biswas and Wrick Talukdar},
  journal= {arXiv preprint arXiv:2601.14298},
  year   = {2026}
}