中文

大语言模型未谈论的内容:关于内容监管与审查实践的实证研究

计算与语言 2025-04-08 v1 计算机与社会 机器学习

摘要

大语言模型(LLM)正日益被用作信息门户,但其内容监管实践仍受到 insufficient 关注。本研究探讨了 LLM 在回答政治话题时拒绝回答或省略信息的程度。为此,我们区分了硬性审查(即生成的拒绝答复、错误消息或预设的否认响应)和软性审查(即选择性省略或淡化关键要素),在 LLM 回复中识别这些现象。我们的分析覆盖来自西方国家、中国和俄罗斯的 14 台最先进模型,测试语言覆盖联合国六项官方语言。我们的分析表明,尽管各方均观察到审查现象,但主要针对 LLM 提供方的国内受众进行定制,通常表现为硬性审查或软性审查(但很少同时两者兼而不之)。这些发现凸显了在公开可用的 LLM 中需要更广泛的意识形态和地理多样性,以及在 LLM 监管策略中需要更大的透明度,以便用户能够做出知情选择。所有数据均已公开免费提供。

关键词

引用

@article{arxiv.2504.03803,
  title  = {What Large Language Models Do Not Talk About: An Empirical Study of Moderation and Censorship Practices},
  author = {Sander Noels and Guillaume Bied and Maarten Buyl and Alexander Rogiers and Yousra Fettach and Jefrey Lijffijt and Tijl De Bie},
  journal= {arXiv preprint arXiv:2504.03803},
  year   = {2025}
}

备注

17 pages, 38 pages in total including appendix; 5 figures, 22 figures in appendix