中文

理解大语言模型中的审查:从机制到治理

计算机与社会 2026-06-16 v1

摘要

大语言模型(LLM)日益成为信息获取的中介,然而其回应受到训练数据策展、对齐程序、提供商政策、推理时审核和司法管辖区法规的影响。本文将LLM审查视为一种社会技术现象,其范围超越了明确的拒绝,还包括遗漏、选择性强调、框架效应和地理上可变的内容控制。我们综合了最近的实证研究、提供商案例研究、监管发展、审计方法和缓解策略,以阐明类似审查的行为如何在模型生命周期中产生。分析强调了安全与开放之间的张力、衡量软性审查的困难、审核机制的地缘政治分歧,以及对透明、可争议和可独立审计的治理机制的需求。我们认为,核心挑战不在于LLM是否应该审核内容,而在于如何使审核做到相称、负责、多元,并抵制不透明的认知控制。

关键词

引用

@article{arxiv.2606.30661,
  title  = {Understanding Censorship in Large Language Models: From Mechanisms to Governance},
  author = {Quanyan Zhu},
  journal= {arXiv preprint arXiv:2606.30661},
  year   = {2026}
}