无授权的识别:LLMs 与线上建议中的道德秩序
计算机与社会
2026-04-27 v1 计算与语言
摘要
大型语言模型日益被用于调解日常人际困境,但其建议默认如何与特定社区的高度集中道德秩序互动,仍鲜有了解。本文将四种类助理型 LLM 与来自 r/relationship_advice 子版块的社区认可建议进行比较,分析 11,565 篇帖子。该子版块作为一种集中、投票确认的道德形成,其命令明确性使得差异可衡量。在所有模型中,LLM 识别出许多与人类评论者相同的动态,但显著不太可能将这种识别转化为行动的指令性授权。在社区共识最强的情境——即涉及滥用或安全威胁的高共识帖子——模型建议的退出行为大约只有人类水平的一半,同时保持较高的保留、验证和治疗性表述。本文将这一模式称为“无授权的识别”:即能够注册伤害,却不承担社区认可的、对结果行动的许可。这种差异并非偶然,而是结构性的:一种可移植的建议风格,在各种情境下均保持着验证性、风险规避性和弱指令性。安全对齐可能是这一模式的一个合理贡献者,另外还有训练数据平均化和更广泛的助理设计。本文认为,模型之间的差异可以从技术错误重新框定为一种见识方式,揭示当标准化助理规范遇到特定情境道德世界时,所掩盖的东西。
引用
@article{arxiv.2604.22143,
title = {Recognition Without Authorization: LLMs and the Moral Order of Online Advice},
author = {Tom van Nuenen},
journal= {arXiv preprint arXiv:2604.22143},
year = {2026}
}