中文

自动化议会:解决语言模型中的决策不确定性与错位问题

人工智能 2023-11-20 v1

摘要

随着人工智能在现代世界中扮演越来越重要的角色,确保 AI 模型能够克服决策不确定性并保持与人类道德和利益的一致至关重要。本研究论文提出了一种通过自动化议会(Automated Parliaments, APs)改进语言模型(LMs)决策的方法——APs 是由代表特定视角的 AI 代表构成的构造。代表本身由三种 AI 模型组成:生成器、修改器和评估器。我们规定了两种产生最优解的机制:用于响应生成的同步修改(Simultaneous Modification)机制,以及用于公平评估解的评估机制。整体过程始于每个生成器创建与其代表理论一致的响应。修改器改变所有其他响应,使其更自我一致。评估器共同评估最佳最终响应。最后,修改器和生成器从评估器的反馈中学习。在我们的研究中,我们测试了评估机制,比较了在评估道德争议场景时单值零样本提示(zero-shot prompting)与 AP 少样本提示(few-shot prompting)的使用。我们发现,与基线相比,AP 架构的损失值降低了 57.3%。最后我们讨论了 APs 的一些潜在应用,特别是其作为自动化道德议会(Automated Moral Parliaments)实现时的潜在影响。

关键词

引用

@article{arxiv.2311.10098,
  title  = {Automated Parliaments: A Solution to Decision Uncertainty and Misalignment in Language Models},
  author = {Thomas Forster and Jonathan Ouwerx and Shak Ragoler},
  journal= {arXiv preprint arXiv:2311.10098},
  year   = {2023}
}

备注

39 pages, 4 figures