语言模型应被用于揭示科学与社会的未书面规范
计算机与社会
2026-01-28 v6 计算与语言
数字图书馆
摘要
本文呼吁研究社区不仅要调查如何继承人类偏见,还要探索如何利用这些偏见来让社会的"未书面规范"——如隐含偏见和启发式规则——变得可见可 critique。我们通过科学中的一个案例研究引入了概念框架:发现同行评审中隐藏的规则——评审者因规范性科学期望而很少明确表达的关注因素。该框架的核心思想是推动语言模型通过生成自洽假设来表达其启发式——解释为何一篇论文在评审评分中表现更突出——针对46个学术会议提交的配对论文,同时在无法用现有假设解释的剩余配对中迭代寻找更深层的假设。我们观察到,语言模型关于良好科学内部特征的规范性先验(例如理论严谨性)从其自我交谈中提取出来,会系统性地向强调外部联系叙事的后验概率更新,例如如何在文献中以及跨文献间定位和连接这一工作。人类评审者倾向于明确奖励与语言模型规范性先验 moderately 对齐的方面(相关性 = 0.49),但避免在评论中表达语境化和叙事后验概率(相关性 = -0.14),尽管他们会通过积极评分来隐含地奖励这些方面。这些模式在不同模型和样本外判断中均具有鲁棒性。我们讨论了该提议框架的广泛适用性,利用语言模型作为诊断工具来放大和显现人类社会背后的隐性规范,使其公开讨论,从而实现更精确的负责任 AI。
引用
@article{arxiv.2505.18942,
title = {Language Models Should be Used to Surface the Unwritten Code of Science and Society},
author = {Honglin Bao and Siyang Wu and Jiwoong Choi and Yingrong Mao and James A. Evans},
journal= {arXiv preprint arXiv:2505.18942},
year = {2026}
}