LLM 导演的模糊性坍塌:认识风险的分类学
计算机与社会
2026-03-09 v1 人工智能
摘要
大语言模型(LLMs)日益增多地用于理解模糊的、开放质感的、价值导向的术语。平台通常依赖LLMs进行内容审核,要求它们根据争议性概念(如“仇恨言论”或“煽动”)对文本进行标记;招聘经理可能使用LLMs来排序谁符合“合格”。AI实验室越来越多地训练模型在基于“偏见”或“正当”等含糊原则的宪法式指导下进行自我调节。本文引入模糊性坍塌这一现象:当LLM遇到确实容纳多个合法解释的术语时,却产生单一解决方式,这种方式绕过了人类平常通过协商、争议和正当化来协调意义的实践。drawing on 关于模糊性作为生产性认知资源的跨学科论述,我们发展了模糊性坍塌在三个层面上所构成的认识风险分类学:过程层面(压制了协商机会、发展认知技能和塑造争议术语的机会),输出层面(扭曲了代理人所依赖的概念和理由),生态系统层面(重塑了共享词汇表、解释规范以及概念如何随时间演变的方式)。我们通过三个案例研究说明这些风险,并得出通过培训、制度部署设计、界面 affordances以及管理不明确提示词的多层次缓解原则,以目标是设计能够显现、保持和负责任地治理模糊性的系统。
引用
@article{arxiv.2603.05801,
title = {Ambiguity Collapse by LLMs: A Taxonomy of Epistemic Risks},
author = {Shira Gur-Arieh and Angelina Wang and Sina Fazelpour},
journal= {arXiv preprint arXiv:2603.05801},
year = {2026}
}