自适应对齐:通过多目标强化学习实现面向多元 AI 的动态偏好调整
机器学习
2024-11-01 v1 人工智能
摘要
新兴的多元人工智能(AI)对齐研究旨在解决如何根据多样化的人类需求和价值观设计和部署智能系统。我们通过多目标强化学习(MORL),借助学习后策略选择调整,提出了一种动态方法,使 AI 与多样且变化的用户偏好对齐,为这一目标做出贡献。在本文中,我们介绍了该方法的拟议框架,概述了其预期优势和假设,并讨论了实现的技术细节。我们还通过社会技术系统的视角,探讨了采用追溯式对齐方法的更广泛影响。
引用
@article{arxiv.2410.23630,
title = {Adaptive Alignment: Dynamic Preference Adjustments via Multi-Objective Reinforcement Learning for Pluralistic AI},
author = {Hadassah Harland and Richard Dazeley and Peter Vamplew and Hashini Senaratne and Bahareh Nakisa and Francisco Cruz},
journal= {arXiv preprint arXiv:2410.23630},
year = {2024}
}
备注
Accepted for the Pluralistic Alignment workshop at NeurIPS 2024