中文

泛化类比:将 AI 监督泛化至难以度量领域的测试平台

人工智能 2023-12-19 v3 计算与语言 机器学习

摘要

随着 AI 系统愈发智能且其行为更难以评估,它们可能学会利用人类反馈的缺陷进行博弈,而非真正遵循指令;然而,通过控制 LLM 如何将人类反馈泛化至其不可靠的情形,可缓解此风险。为更好理解奖励模型如何泛化,我们构建了涵盖 8 类共 69 个分布偏移。我们发现奖励模型默认并未学会评估“指令遵循”,而是偏好类似互联网文本的 persona。解释奖励模型内部表征的技术比标准微调具有更好的泛化性,但仍频繁无法区分指令遵循与混淆行为。我们将最具挑战性的 15 个分布偏移整合为 GENeralization analogIES(GENIES)基准,期望其能推动对奖励模型泛化的控制取得进展。

关键词

引用

@article{arxiv.2311.07723,
  title  = {Generalization Analogies: A Testbed for Generalizing AI Oversight to Hard-To-Measure Domains},
  author = {Joshua Clymer and Garrett Baker and Rohan Subramani and Sam Wang},
  journal= {arXiv preprint arXiv:2311.07723},
  year   = {2023}
}

备注

Code: https://github.com/Joshuaclymer/GENIES Website: https://joshuaclymer.github.io/generalization-analogies-website/